Le catalogue
Modèles d'IA et les GPU qui les exécutent
Chaque grand modèle de langage que nous avons dans notre base de données, avec son nombre de paramètres, qui l'a construit, et si les poids sont suffisamment ouverts pour le télécharger et l'exécuter vous-même. Ouvrez n'importe quel modèle pour voir quels GPU peuvent le supporter, à quelle quantification, et combien de tokens par seconde vous pouvez attendre..
C'est l'inverse de commencer par le matériel. Si vous savez déjà quel modèle vous voulez, c'est ici que vous découvrez ce qu'il faut pour le faire fonctionner. — le catalogue GPU fonctionne à l'inverse, en partant d'une carte que vous possédez déjà.
3,567
modèles en base
1,335
avec des poids ouverts
2,232
fermé ou non déclaré
1,314
organisations
50
pays
Chaque mot doit correspondre à quelque chose, donc plus de mots réduisent la liste. Une taille comme 27b correspond au nombre de paramètres même lorsque le nom ne le mentionne pas..
paramètres N'importe – N'importe
3,567 les modèles correspondent
Mise à jour| Poids | Domaine | ||||
|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic United States of America | — | Jul 2026 | Fermé | Language, Vision, Multimodal |
| Gemini 3.5 Flash Cyber | Google DeepMind United States of America | — | Jul 2026 | Fermé | Language, Multimodal, Vision |
| Gemini 3.5 Flash-Lite | Google DeepMind United States of America | — | Jul 2026 | Fermé | Language, Multimodal, Vision |
| Gemini 3.6 Flash | Google DeepMind United States of America | — | Jul 2026 | Fermé | Language, Multimodal, Vision |
| Kimi K3 | Moonshot China | 2.8T | Jul 2026 | Fermé | Language, Multimodal, Vision |
| Inkling | Thinking Machines United States of America | 975B | Jul 2026 | Ouvert | Language, Multimodal, Audio, Video, Vision |
| Inkling-Small | Thinking Machines United States of America | 276B | Jul 2026 | Fermé | Language, Multimodal, Audio, Video, Vision |
| GPT-5.6 Luna | OpenAI United States of America | — | Jul 2026 | Fermé | Multimodal, Language, Vision |
| GPT-5.6 Sol | OpenAI United States of America | — | Jul 2026 | Fermé | Multimodal, Language, Vision |
| GPT-5.6 Terra | OpenAI United States of America | — | Jul 2026 | Fermé | Multimodal, Language, Vision |
| Muse Spark 1.1 | Meta AI United States of America | — | Jul 2026 | Fermé | Language |
| Grok 4.5 | xAI United States of America | 1.5T | Jul 2026 | Fermé | Language |
| Muse Image | Meta AI United States of America | — | Jul 2026 | Fermé | Image generation |
| GPT-Realtime-2.1-Mini | OpenAI United States of America | — | Jul 2026 | Fermé | — |
| Claude Sonnet 5 | Anthropic United States of America | — | Jun 2026 | Fermé | Language, Multimodal |
| Solar Open2 250B | Upstage Korea (Republic of) | 250.3B | Jun 2026 | Ouvert | Language |
| GLM-5.2 | Z.ai (Zhipu AI) China | 744B | Jun 2026 | Ouvert | Language |
| Kimi K2.7 Code | Moonshot China | 1T | Jun 2026 | Ouvert | Language, Multimodal, Vision |
| Claude Fable 5 | Anthropic United States of America | — | Jun 2026 | Fermé | Language, Multimodal |
| Claude Mythos 5 | Anthropic United States of America | — | Jun 2026 | Fermé | Language, Multimodal |
| North Mini Code | Cohere Canada | 30B | Jun 2026 | Ouvert | Language |
| Nemotron 3 Ultra | NVIDIA United States of America | 550B | Jun 2026 | Ouvert | Language |
| Gemma 4 12B | Google DeepMind United States of America | 12B | Jun 2026 | Ouvert | Language, Multimodal, Audio |
| MAI-Image-2.5 | Microsoft United States of America | — | Jun 2026 | Fermé | Image generation |
| MAI-Thinking-1 | Microsoft United States of America | 962B | Jun 2026 | Fermé | Language |
| MiniMax-M3 | MiniMax China | — | Jun 2026 | Fermé | Language, Multimodal |
| Claude Opus 4.8 | Anthropic United States of America | — | May 2026 | Fermé | Language |
| Qwen 3.7 Max | Alibaba China | — | May 2026 | Fermé | Language |
| Qwen3.7-Max | Alibaba China | — | May 2026 | Fermé | Language |
| Composer 2.5 | Cursor United States of America | 1T | May 2026 | Fermé | Language |
Étape par étape
Comment découvrir quelle GPU exécute un modèle d'IA
Chaque modèle open-weight ici a déjà été évalué par rapport à chaque carte graphique pour laquelle nous avons des spécifications. Obtenir la réponse prend six étapes..
-
01
Trouver le modèle
Recherche par nom, ou par taille — taper 27b correspond au compte de paramètres même lorsque le nom ne le mentionne pas. Chaque mot doit correspondre à quelque chose, donc plus de mots affinent encore la liste.
-
02
Resserrez aux modèles que vous pouvez réellement exécuter
Réglez la disponibilité uniquement aux open weights. Un modèle fermé ne peut pas être téléchargé ou exécuté sur votre propre matériel à aucun prix, donc les filtrer laisse uniquement les modèles pour lesquels une réponse matérielle existe.
-
03
Définissez une plage de taille qui convient à votre matériel
Utilisez le curseur de paramètres. En gros, un modèle nécessite un peu plus de la moitié d'un gigaoctet par milliard de paramètres au niveau de compression le plus utilisé — donc une carte avec 24 Go de mémoire est confortable jusqu'à environ trente milliards de paramètres.
-
04
Ouvrez le modèle
Sa page répertorie chaque carte graphique capable de le faire fonctionner, avec la plus petite carte qui convient, la plus rapide, et une estimation du nombre de tokens par seconde pour chacune. C'est l'opposé de partir du matériel, et c'est généralement la direction la plus utile lorsque vous savez déjà quel modèle vous voulez.
-
05
Ajustez la longueur de contexte et la qualité
Sur la page du modèle, définissez la longueur de conversation à laquelle vous vous attendez à travailler et la compression la plus basse que vous accepterez. Les deux modifient la réponse plutôt que de la filtrer — une longue conversation nécessite considérablement plus de MEMORY qu'une courte, et peut rendre un modèle inaccessible à une CARD qui pourrait autrement le contenir.
-
06
Lisez la plage, pas le seul nombre
Chaque chiffre de débit comporte une plage de confiance, et la plage est la réponse. Le même modèle sur la même carte varie entre les moteurs d'inférence et entre les versions d'un moteur, de plus que la plupart des différences que vous comparez.
Ce que les chiffres signifient
À quoi sert ce catalogue
Un enregistrement couvrant 3,567 modèles d'apprentissage automatique — qui a construit chacun, où, quand, quelle est sa taille, et si ses poids ont été publiés. C'est plus large qu'une liste de choses que vous pouvez exécuter : un modèle que personne ne peut télécharger a toujours une spécification qui mérite d'être lue, et savoir ce qui existe fait partie de l'évaluation de ce qui vaut la peine d'être exécuté.
Ce qui rend ce catalogue différent d'un index classique, c'est qu'il est associé à un calculateur matériel. Chaque modèle dont les poids sont OPEN et dont la taille est EN REGISTRE a été évalué par rapport à chaque carte graphique pour laquelle nous avons des spécifications. Ouvrez-en un et il vous indique quelles cartes peuvent le faire fonctionner, combien de MÉMOIRE chacune nécessite, et combien de TOKENS par seconde vous pouvez attendre.
Poids ouverts et modèles fermés
Ouvrir les poids
1,335
fermé ou non déclaré
2,232
organisations
1,314
Le fait le plus conséquent concernant un modèle est de savoir si ses poids ont été publiés. Les poids d'un modèle sont les valeurs entraînées qui en font ce qu'il est — des centaines de milliards de nombres obtenus après des mois de calcul. Les publier signifie que quiconque peut télécharger le modèle et l'exécuter sur son propre matériel, de manière permanente, sans compte et sans connexion réseau. Ne pas les publier signifie que le modèle existe uniquement en tant que service, accessible par une interface contrôlée par son propriétaire.
Cette distinction décide de tout le reste sur ce site. Un modèle fermé ne peut être exécuté localement à aucun prix, donc aucun changement de carte GPU ne change la réponse et aucun chiffre de mémoire ne s'applique à cela. Un modèle open weight peut être exécuté par quiconque a un matériel suffisamment grand pour le contenir, ce qui transforme "quel modèle devrais-je utiliser" en une question avec une réponse matérielle.
« Poids ouverts » n'est pas le même que logiciel libre dans le sens que le terme porte habituellement. Le fait que les poids soient téléchargeables ne dit rien sur les données d'entraînement, le code d'entraînement, ou la licence attachée au résultat — certains modèles publiés permettent l'utilisation commerciale librement, d'autres la restreignent. Ce qui est cohérent, c'est que le modèle s'exécute sur votre machine plutôt que sur celle de quelqu'un d'autre.
Ce catalogue contient 3,567 modèles. Parmi ceux-ci, 1,335 avoir des poids ouverts et 2,232 ne pas — à peu près 37 Dans chaque centaine, il y a quelque chose que vous pourriez télécharger aujourd'hui. Là où la licence n'a jamais été enregistrée, nous la comptons comme fermée, sur le principe qu'une licence non déclarée n'est pas une sur laquelle on peut compter.
Que vous dit réellement un compte de paramètres
Les paramètres sont les valeurs apprises à l'intérieur d'un modèle — les nombres ajustés pendant l'entraînement qui codent tout ce qu'il sait. Un modèle décrit comme 8B en a environ huit milliards, et chacun occupe de l'espace dans la mémoire. C'est pourquoi le nombre de paramètres est la colonne qui compte le plus ici : c'est la chose la plus proche d'une déclaration directe de la quantité de matériel dont un modèle a besoin.
La relation est proche de linéaire, mais la constante dépend de la façon dont le modèle est stocké. À pleine précision, chaque paramètre prend deux octets, donc un modèle de huit milliards de paramètres nécessite seize gigaoctets avant que quoi que ce soit d'autre ne soit pris en compte. Comprimé à environ quatre bits — ce que la plupart des gens exécutant des modèles localement utilisent en réalité — le même modèle nécessite plutôt cinq, à un coût modeste et généralement acceptable en précision.
Deux choses compliquent cela. Les modèles de mélange d'experts acheminent chaque jeton à travers seulement une fraction d'eux-mêmes, de sorte qu'ils génèrent du texte à la vitesse de quelque chose de bien plus petit tout en nécessitant chaque paramètre résidant en mémoire — rapide, mais pas bon marché à maintenir. Et la conversation elle-même prend de la mémoire qui grandit à mesure que la conversation se développe, ce qui explique pourquoi un modèle qui s'adapte confortablement aux questions courtes peut échouer sur un long document.
Plus grand n'est pas automatiquement mieux, et de plus en plus cela ne l'est pas. La capacité par paramètre s'est améliorée assez fortement pour qu'un modèle récent à huit milliards de paramètres surpasse régulièrement un ancien modèle plusieurs fois plus grand, tout en tenant sur un matériel que l'ancien modèle n'aurait jamais pu supporter. Trier ce catalogue par date de sortie est généralement un meilleur guide que de le trier par taille.
Comment les modèles de langue sont arrivés ici
Presque tous les modèles de ce catalogue descendent d'une idée architecturale unique publiée en 2017, dans un document intitulé "Attention Is All You Need". Il a introduit le transformeur, qui traite une séquence entière à la fois et apprend quelles parties de celle-ci ont un rapport avec lesquelles — remplaçant les conceptions récurrentes étape par étape qui ont précédé, et se scalant bien mieux qu'elles ne le faisaient. Chaque modèle énuméré ici qui génère du texte est un transformeur ou un proche parent de celui-ci.
Ce qui a suivi était principalement une démonstration que l'architecture continuait à s'améliorer avec l'échelle. Les modèles successifs ont augmenté de plusieurs ordres de grandeur et ont gagné en capacités correspondantes, ce qui a établi le schéma pendant plusieurs années : plus de paramètres, plus de données d'entraînement, plus de calcul. En 2020, les plus grands modèles étaient suffisamment capables pour être commercialement sérieux, et ils n'étaient accessibles que sous forme de services payants — les poids restaient avec ceux qui les avaient entraînés.
Le tournant est venu en 2023, quand plusieurs organisations ont commencé à publier des poids pour des modèles suffisamment bons pour valoir la peine d'être exécutés. Cela a changé la question de "à quel service dois-je m'abonner" à "que peut faire mon propre matériel", et c'est la raison pour laquelle un site comme celui-ci existe. Avant cela, la question matérielle n'avait pas de réponse significative pour la plupart des gens.
Les années qui ont suivi ont été moins axées sur l'échelle et plus sur l'efficacité. De meilleures méthodes d'entraînement, de meilleures données et des travaux architecturaux tels que le routage de mélange d'experts ont tous poussé la capacité par paramètre vers le haut, tandis que la quantification — stocker chaque poids en quatre ou cinq bits au lieu de seize — a réduit la mémoire dont un modèle donné a besoin d'environ trois quarts. Entre eux, des modèles qui nécessitaient autrefois un centre de données fonctionnent désormais sur une carte graphique de bureau, ce qui constitue le développement pratique sur lequel repose tout ce catalogue.
Le catalogue tel qu'il est
Modèle le plus grand
173.9T
pays
50
Le plus grand modèle dans notre base de données est BaGuaLu, atteindre 173.9T paramètres. À cette échelle, un modèle est une infrastructure de centre de données plutôt que quelque chose qu'un poste de travail détient, et la figure est plus utile comme un marqueur de l'emplacement de la frontière que comme une décision d'achat.
Le catalogue couvre le travail de 1,314 organisations, réparties sur 50 pays. Cette répartition mérite d'être remarquée à elle seule : le développement de modèles a cessé d'être concentré dans une poignée de laboratoires il y a quelque temps, et plusieurs des modèles open weight les plus largement utilisés proviennent d'organisations qui n'existaient pas quelques années auparavant.
Les comptes de paramètres sont enregistrés pour 2,315 entrées, hors d'un catalogue contenant 3,567. Les lacunes sont principalement des modèles dont les propriétaires n'ont jamais publié de taille, et occasionnellement des modèles ouverts que personne n'a mesurés. Un modèle sans ce chiffre est répertorié mais ne peut pas se voir attribuer une estimation de mémoire ou de vitesse, puisque chacun de ces calculs commence à partir de cela.
Les entrées commencent dans 1950 et exécutez pour 2026, donc le catalogue est un enregistrement du domaine plutôt qu'un instantané de ce qui est actuel. Filtrer par année de sortie est le moyen le plus rapide de le réduire à des modèles qui valent réellement la peine d'être considérés.
La frontière
Les dix plus grands modèles d'IA à poids ouvert
Les plus grands modèles que quiconque peut réellement télécharger, les plus récents d'abord lorsque les tailles se lient. Ce sont les limites supérieures de ce qui est exécutable sur votre propre matériel — bien qu'à cette échelle, cela signifie généralement plusieurs CARDS plutôt qu'une seule..
- 01 DeepSeek-V4-Pro DeepSeek · Apr 2026 1.6T
- 02 QMoE: compressed SwitchTransformer Institute of Science and Technology Austria (ISTA),Neural Magic · Oct 2023 1.6T
- 03 Switch Google · Jan 2021 1.6T
- 04 MoE-1.1T Meta AI · Dec 2021 1.1T
- 05 Kimi K2.7 Code Moonshot · Jun 2026 1T
- 06 Kimi K2.6 Moonshot · Apr 2026 1T
- 07 Kimi K2.5 Moonshot · Feb 2026 1T
- 08 MiMo-V2.5-Pro Xiaomi Corp · Apr 2026 1T
- 09 Kimi K2 Thinking Moonshot · Nov 2025 1T
- 10 Ring-1T Ant Group · Oct 2025 1T
Les dix plus grands modèles d'IA fermés
Les plus grands modèles dont les poids n'ont jamais été publiés. Aucun de ceux-ci ne peut être exécuté sur votre propre matériel à aucun prix — ils sont listés car ils marquent la frontière contre laquelle les modèles open weight sont mesurés..
- 01 BaGuaLu Tsinghua University,Zhejiang Lab,Beijing Academy of Artificial Intelligence / BAAI,Alibaba · Mar 2022 173.9T
- 02 Persia ETH Zurich,Kuaishou Technology · Nov 2021 100T
- 03 DLRM-12T Meta AI,Carnegie Mellon University (CMU) · Apr 2021 12T
- 04 M6-10T Alibaba · Oct 2021 10T
- 05 Grok 4 xAI · Jul 2025 3T
- 06 Grok 3 xAI · Feb 2025 3T
- 07 DLRM-2022 Facebook · Sep 2021 3T
- 08 Kimi K3 Moonshot · Jul 2026 2.8T
- 09 Llama 4 Behemoth (preview) Meta AI · Apr 2025 2T
- 10 GPT-4 (Jun 2023) OpenAI · Jun 2023 1.8T
Les sorties open-weight les plus récentes
Les dernières additions avec des poids publiés. La capacité par paramètre s'est améliorée régulièrement, donc un modèle récent est généralement une meilleure utilisation de la même mémoire qu'un modèle plus ancien et plus grand..
Lecture du tableau
Comment lire ce catalogue
- paramètres
- Le nombre total de valeurs apprises, écrit de la manière dont le domaine l'écrit : 8B est huit milliards, 1.6T est 1.6 trillion. C'est le total, pas le nombre utilisé par mot — les modèles mixture-of-experts utilisent seulement une fraction par token mais doivent toujours garder tout cela dans la mémoire.
- Ouvrir les poids
- Que les valeurs entraînées peuvent être téléchargées et exécutées sur votre propre matériel. Un modèle fermé n'est accessible que par son fournisseur, donc aucune carte graphique ne le rend exécutable localement. Lorsque la licence n'a jamais été enregistrée, nous le considérons comme fermé plutôt que de supposer le contraire.
- Domaine et tâche
- Ce à quoi le modèle a été conçu pour fonctionner. Un modèle peut en porter plusieurs de chaque, c'est pourquoi choisir un domaine réduit la liste des tâches plutôt que de la remplacer.
- Organisation et pays
- Qui a publié le modèle et où ils sont basés. Utile lorsque un déploiement doit satisfaire une règle concernant l'origine d'un modèle.
- Nouvelles versions
- Lorsque le modèle a été publié. Généralement un meilleur indicateur de qualité que la taille, car la capacité par paramètre s'est améliorée si rapidement.
Réponses
questions courantes
Comment savoir quelle GPU peut exécuter un modèle AI donné ?
Trouvez le modèle dans le tableau ci-dessus et ouvrez-le. Sa page répertorie chaque GPU CARTE dans notre catalogue qui peut le contenir, avec la MÉMOIRE dont chacun a besoin, la compression à laquelle il fonctionnerait et une estimation du nombre de jetons par seconde. Vous pouvez également l'aborder dans l'autre sens et partir d'une carte que vous possédez déjà.
Combien de modèles AI sont dans cette base de données ?
Le catalogue contient 3,567 modèles. Poids ouverts, téléchargeables et exécutables sur votre propre matériel, couvrent 1,335 d'eux. 2,232 sont fermés, ou leur licence n'a jamais été enregistrée.
Quelle est la différence entre un modèle open weight et un modèle fermé ?
Un modèle à poids ouvert a publié ses valeurs entraînées, de sorte que quiconque peut le télécharger et l'exécuter sur sa propre machine, indéfiniment et hors ligne. Un modèle fermé n'existe que comme un service contrôlé par son propriétaire. Seuls les modèles à poids ouvert ont une exigence matérielle significative, c'est pourquoi les modèles fermés sur ce site portent une spécification mais pas de tableau de carte GPU.
Les poids ouverts sont-ils les mêmes que le code source ouvert ?
Pas tout à fait. Les poids publiés ne disent rien sur les données d'entraînement, le code d'entraînement ou la licence attachée au résultat — certains permettent l'utilisation commerciale librement, d'autres la restreignent. Ce qu'ils garantissent, c'est que le modèle fonctionne sur votre matériel plutôt que sur celui de quelqu'un d'autre, ce qui est la partie qui compte pour ce site.
Qui construit ces modèles d'IA ?
Le catalogue couvre 1,314 organisations, réparties sur 50 pays — groupes universitaires, laboratoires indépendants et les branches de recherche des grandes entreprises technologiques. Le développement de modèles a cessé d'être concentré dans quelques endroits il y a quelque temps, et plusieurs modèles open weight largement utilisés proviennent d'organisations qui n'ont que quelques années.
Quel est le plus grand modèle d'IA ?
Le plus grand dans notre base de données est BaGuaLu, atteindre 173.9T Paramètres. À cette taille, un modèle est une infrastructure de datacentre plutôt que quelque chose qu'une seule carte graphique détient — les plus grands modèles open-weight qui tiennent sur une carte sont considérablement plus petits et sont répertoriés plus bas sur cette page.
Que signifient les paramètres ?
Les paramètres sont les valeurs apprises à l'intérieur d'un modèle, et leur nombre est la chose la plus proche d'une déclaration directe de la quantité de mémoire dont il a besoin. Une estimation approximative est un peu plus de la moitié d'un gigaoctet par milliard de paramètres avec la compression que la plupart des gens utilisent — donc un modèle à huit milliards de paramètres est confortable sur huit gigaoctets, et trente milliards ont besoin d'environ vingt-quatre.
Un plus grand modèle AI est-il toujours meilleur ?
Non, et de plus en plus non. La capacité par paramètre s'est considérablement améliorée, donc un modèle récent à huit milliards de paramètres surpasse souvent un ancien plusieurs fois plus grand tout en s'adaptant à du matériel que l'ancien ne pourrait jamais. Trier par date de sortie est généralement un meilleur indicateur que trier par taille.
Qu'est-ce qu'un modèle de mélange d'experts ?
Un modèle qui fait passer chaque jeton uniquement par une fraction de lui-même plutôt que par chaque paramètre. Cela lui permet de générer du texte à la vitesse d'un modèle beaucoup plus petit — mais chaque expert doit toujours être présent en mémoire, donc il est rapide sans être bon marché à maintenir. Le catalogue indique le nombre total de paramètres, qui est le chiffre déterminant s'il s'adapte.
Pourquoi certains modèles n'ont-ils pas de comptage de paramètres ?
Parce que l'organisation n'en a jamais publié. C'est courant pour les modèles fermés et cela arrive parfois avec les ouverts. Les décomptes sont enregistrés pour 2,315 entrées, hors d'un catalogue contenant 3,567. Nous listons le reste plutôt que de les cacher, mais aucun chiffre de mémoire ou de vitesse ne peut être produit sans ce nombre.
Puis-je exécuter ces modèles sans connexion Internet ?
Tout modèle OPEN WEIGHT, oui — c'est le but des poids publiés. Une fois téléchargé, il fonctionne entièrement sur votre propre machine sans compte ni réseau. Les modèles fermés ne peuvent pas être exécutés hors ligne du tout, car vous ne détenez jamais le modèle lui-même.
Quelle est la précision des estimations matérielles sur ce site ?
Ils sont calculés à partir des spécifications plutôt que mesurés, et chaque chiffre est publié sous forme d'une plage plutôt qu'un seul nombre. Le même modèle et la même carte varient de trente à cinquante pour cent selon le logiciel d'inférence utilisé et quelle version de celui-ci, ce qu'aucun calcul à partir des spécifications ne peut prédire. Considérez la plage comme la réponse honnête.
J'ai déjà une carte graphique. Puis-je chercher à l'envers ?
Oui. Le catalogue GPU liste chaque carte pour laquelle nous avons des spécifications, et la page de chaque carte nomme chaque modèle qu'elle peut exécuter, du plus rapide au plus lent. C'est le même calcul considéré du côté matériel.
L'autre direction
Regardez-le de l'autre côté ?
Cette page commence par le modèle et demande quel matériel il nécessite. Si vous possédez déjà une carte et souhaitez savoir ce qu'elle fera tourner, commencez par là à la place. — liste chaque carte dans notre base de données, et chacune nomme les modèles qu'elle peut exécuter, les plus rapides en premier.