Réponses
Questions fréquentes
À propos des estimations, de ce qu'elles signifient et de la façon dont le site fonctionne. Les questions concernant une carte ou un modèle spécifique sont répondues sur la page de cette carte ou de ce modèle..
Que signifie "tokens par seconde" ?
C'est la rapidité avec laquelle un modèle de langue génère du texte sur un GPU donné - combien de tokens (approximativement, morceaux de mots) il produit chaque seconde pendant que vous discutez avec lui. Un nombre plus élevé signifie que les réponses arrivent plus rapidement.
Quelle est la précision des estimations ?
Attendez-vous à ce que le chiffre réel se situe dans environ 20 à 40 % de l'estimation. Le même GPU et modèle varient autant entre les moteurs d'inférence, les versions des moteurs et la configuration de service — aucune fiche technique ne prédit cela, c'est pourquoi chaque chiffre sur ce site est publié sous forme de plage plutôt que comme un seul numéro.
Pourquoi votre chiffre est-il si inférieur à celui du débit qu'un fournisseur de matériel publie ?
Le débit publié par le vendeur est généralement mesuré en servant des centaines de demandes à la fois. Notre chiffre est pour une personne parlant au modèle, une demande à la fois — le nombre qui décrit réellement l'exécution d'un modèle localement. Les deux ne sont pas comparables.
Que signifie qu'un modèle "s'adapte" sur un GPU ?
Que les poids du modèle, son cache de conversation et les frais généraux de l'exécution s'insèrent tous dans la mémoire utilisable de la carte à une quantification donnée. Un modèle peut s'insérer de manière serrée, confortable ou pas du tout — nous montrons lequel, ainsi que combien de marge est restante.
Qu'est-ce que la quantification, et pourquoi cela change-t-il si quelque chose s'adapte ?
La quantification comprime les poids d'un modèle pour économiser de la mémoire, à un petit coût pour la qualité de sortie. Un modèle qui ne rentre pas à pleine précision s'adapte souvent confortablement à une quantification inférieure — nous rapportons toujours la meilleure qualité qui s'adapte à une carte donnée.
Quelles GPU couvrez-vous ?
Des milliers de cartes de NVIDIA, AMD, Intel et Apple Silicon, des accélérateurs de centre de données aux cartes grand public. La couverture et la confiance des estimations sont meilleures sur le matériel moderne de NVIDIA, où les moteurs d'inférence sous-jacents sont les plus matures.
gputps.com est-il gratuit à utiliser ?
Oui — la navigation sur les GPU, les modèles et toutes les estimations sur le site est gratuite, sans compte requis.
Comment puis-je lister une GPU à vendre ?
Enregistrez un compte vendeur gratuit et ajoutez vos annonces — elles apparaissent directement sur la page de la carte correspondante. Consultez la page devenir-vendeur pour voir comment cela fonctionne et les tarifs actuels.
Toujours à la recherche
Vous ne trouvez pas ce que vous cherchez ?
Trouvé un chiffre erroné, GPU manquant ou avez une suggestion ? Nous aimerions l'entendre..
La méthode
Comment les estimations sont construites
Les fiches techniques vous indiquent ce qu'est un GPU. Elles ne vous indiquent pas ce qu'il fait avec un modèle de langage. C'est le fossé que nous avons construit ce site pour combler..