Μνήμη-δεσμευμένη απόδοση, υπολογισμένη ζωντανά
Μπορεί η GPU σου να τρέξει αυτό το AI Model; Ο υπολογιστής TPS της GPU
Επιλέξτε μια κάρτα GPU ή ένα μοντέλο γλώσσας και υπολογίζουμε — ζωντανά, όχι από έναν πίνακα αναζήτησης — αν χωράει, με ποιο συμπίεση, και περίπου πόσα tokens ανά δευτερόλεπτο να περιμένετε..
Ζωντανή εκτίμηση
ΕίσοδοςΜορφή
Q8_0
Συγκείμενο
13k
Εμπιστοσύνη
high
Εργασμένα παραδείγματα
Δες αυτούς τους ισχυρούς συνδυασμούς
Λίγοι συνδυασμοί που θα προτείναμε σε έναν φίλο, σε διάφορους προϋπολογισμούς.
01
Σύγκρινε GPUs
VRAM, εύρος ζώνης μνήμης, πυρήνες tensor, απόδοση FP16.
02
Εκτίμηση τοκεν ανά δευτερόλεπτο
Η ταχύτητα αποκωδικοποίησης περιορίζεται από την εύρος ζώνης μνήμης, οπότε την μοντελοποιούμε αντί να αναφέρουμε τις μέγιστες TFLOPS..
03
Έλεγχος τι ταιριάζει
Ποια μοντέλα τρέχουν σε μια ΚΑΡΤΑ, σε ποια ποσοτικοποίηση, και με πόσο context length.
Το πρόβλημα
Γιατί το "θα τρέξει αυτή τη στιγμή η GPU μου;" είναι μια δύσκολη ερώτηση
Ένα φύλλο προδιαγραφών σας λέει τη μνήμη μιας κάρτας και την ταχύτητα ρολογιού της. Δεν σας λέει εάν ένα συγκεκριμένο γλωσσικό μοντέλο χωράει σε αυτή τη μνήμη αφού συμπιεστεί, πόσο από την κάρτα μένει διαθέσιμο για τη συζήτηση αυτή καθαυτή, ή πόσοι τοκεν ανά δευτερόλεπτο βγαίνουν πραγματικά από την άλλη πλευρά — και αυτές οι τρεις ερωτήσεις δεν έχουν την ίδια απάντηση για οποιοδήποτε ζευγάρι GPU και μοντέλου.
Η ειλικρινής έκδοση αυτής της υπολογιστικής διαδικασίας περιλαμβάνει τον αριθμό παραμέτρων του μοντέλου και την αρχιτεκτονική του, τη μορφή συμπίεσης στην οποία είναι αποθηκευμένο, την μνήμη VRAM της κάρτας και πόσο ώριμο είναι το λογισμικό συμπερασμού του, καθώς και το μήκος της συνομιλίας που σκοπεύετε να έχετε μαζί του. Αν κάνετε λάθος σε οποιοδήποτε από αυτά, ο αριθμός που προκύπτει φαίνεται εξίσου σίγουρος και είναι απλώς λάθος.
Δεν προ pretend ότι αυτό παράγει ένα μόνο ακριβές νούμερο, επειδή δεν μπορεί. Αυτό που κάνουμε αντ' αυτού είναι να τρέχουμε τον πλήρη υπολογισμό για κάθε κάρτα και κάθε μοντέλο που έχουμε δεδομένα, να δημοσιεύουμε το αποτέλεσμα ως εύρος αντί για μια ψευδή-ακρίβεια σημειακή τιμή, και να δείχνουμε τη δουλειά μας — κάθε τύπος πίσω από κάθε αριθμό σε αυτόν τον ιστότοπο είναι γραμμένος δημοσίως, όχι κρυμμένος πίσω από την απάντηση.
Τι σας δίνει πραγματικά αυτός ο ιστότοπος
Η πιο πλήρης βάση δεδομένων που μπορέσαμε να συγκεντρώσουμε: χιλιάδες κάρτες GPU και χιλιάδες μοντέλα γλώσσας, που διασταυρώθηκαν μεταξύ τους αντί να εξεταστούν το ένα τη φορά. Ξεκινήστε από μια κάρτα που κατέχετε ή σκέφτεστε, και δείτε κάθε μοντέλο που ταιριάζει σε αυτή. Ξεκινήστε από ένα μοντέλο που θέλετε να τρέξετε, και δείτε κάθε κάρτα που μπορεί να το κρατήσει.
Αυτό λειτουργεί και στις δύο κατευθύνσεις γιατί ο υποκείμενος υπολογισμός είναι συμμετρικός - η ίδια μνήμη και εύρος ζώνης αριθμητική, εκτελείται από οποιαδήποτε πλευρά γνωρίζετε ήδη. Καμία από τις δύο κατευθύνσεις δεν είναι η "πραγματική"; είναι η ίδια απάντηση που ζητήθηκε με δύο διαφορετικούς τρόπους.
Διαβάστε περισσότερα σχετικά με το πώς και γιατί στη βάση δεδομένων μας για σελίδα.
Και οι δύο κατευθύνσεις
Πώς λειτουργεί ο υπολογιστής
Η ίδια υπολογισμός, χρήσιμος από όποια πλευρά της ερώτησης ξεκινάτε..
Αρχίζοντας από μια GPU που κατέχετε
- 01 Βρείτε την κάρτα γραφικών σας . Εξερευνήστε τον κατάλογο GPU για την κάρτα που έχετε ή σκέφτεστε, με βάση το όνομα ή το μέγεθος μνήμης.
- 02 Ανοίξτε τη σελίδα . Κάθε κάρτα έχει τη δική της σελίδα που καταγράφει κάθε γλωσσικό μοντέλο που μπορούμε να εκτιμήσουμε σε σχέση με αυτή, με μια εκτίμηση για τον αριθμό των tokens ανά δευτερόλεπτο για κάθε ένα.
- 03 Ρυθμίστε το context length και το quality floor . Προσαρμόστε το μήκος της συνομιλίας που περιμένετε να εργαστείτε και τη χαμηλότερη συμπίεση που θα αποδεχτείτε. Και οι δύο αλλάζουν την απάντηση σε πραγματικό χρόνο.
- 04 Διάβασε το εύρος, όχι έναν μόνο αριθμό . Κάθε εκτίμηση δημοσιεύεται με εύρος εμπιστοσύνης αντί για μία ψευδή-ακρίβεια τιμή, διότι η ίδια ΚΑΡΤΑ και το ΜΟΝΤΕΛΟ διαφέρουν μεταξύ των μηχανών συμπερασμού με τρόπους που καμία προδιαγραφή δεν προβλέπει.
Αρχίζοντας από ένα μοντέλο που θέλετε να εκτελέσετε
- 01 Βρείτε το μοντέλο . Αναζητήστε τον κατάλογο AI μοντέλου κατά όνομα ή μέγεθος — ακόμη και όταν το όνομα δεν δηλώνει τον αριθμό παραμέτρων.
- 02 Ανοίξτε τη σελίδα . Ένα μοντέλο με OPEN WEIGHTS καταγράφει κάθε κάρτα GPU που μπορούμε να την εκτιμήσουμε, τη μικρότερη που ταιριάζει και την ταχύτερη πρώτα.
- 03 Ρυθμίστε το context length και το quality floor . Οι ίδιες δύο ρυθμίσεις όπως η διαδρομή πρώτης GPU — μια μεγαλύτερη συνομιλία χρειάζεται περισσότερη ΜΝΗΜΗ, η οποία μπορεί να ωθήσει μια ΚΑΡΤΑ από "ταιριάζει" σε "δεν ταιριάζει".
- 04 Σύγκρινε κάρτες με βάση αυτά που θα παρατηρήσεις πραγματικά . Η ΜΝΗΜΗ αποφασίζει αν θα τρέξει καθόλου; η ΣΥΓΧΡΟΝΙΣΜΟΣ αποφασίζει πόσο γρήγορα αισθάνεται μόλις το κάνει. Ο πίνακας ταξινομεί κατά ΤΟΚΕΝ ανά ΔΕΥΤΕΡΟ by default γιατί αυτό συνήθως είναι αυτό που έχει σημασία.
Απαντήσεις
κοινές ερωτήσεις
Πώς υπολογίζω αν η GPU μου μπορεί να τρέξει ένα τοπικό LLM;
Βρείτε την κάρτα σας στον κατάλογο GPU και ανοίξτε τη σελίδα της — παραθέτει κάθε μοντέλο που μπορούμε να αξιολογήσουμε σε σχέση με αυτό, αν κάθε ένα ταιριάζει στη μνήμη, και μια εκτιμώμενη τιμή tokens-per-second. Μπορείτε επίσης να ξεκινήσετε από ένα μοντέλο και να δείτε ποιες κάρτες μπορούν να το τρέξουν, που είναι ο ίδιος υπολογισμός από την αντίθετη κατεύθυνση.
Μπορεί η GPU μου να τρέξει τοπικά LLM μοντέλα καθόλου;
Αν έχει τουλάχιστον μερικά γιγαμπάιτ μνήμης από μόνο του, σχεδόν σίγουρα κάτι. Οι ενσωματωμένες γραφικές μονάδες που μοιράζονται μνήμη συστήματος είναι η κύρια εξαίρεση, καθώς δεν έχουν συγκεκριμένο απόθεμα για να κρατήσουν ένα μοντέλο. Πέρα από αυτό, είναι θέμα ποιο μοντέλο, σε ποια συμπίεση — όχι ναι ή όχι.
Τι καθορίζει τα tokens ανά δευτερόλεπτο σε μια GPU;
Η παραγωγή ενός token σημαίνει ότι διαβάζουμε τα βάρη του μοντέλου από τη ΜΝΗΜΗ μία φορά, έτσι η ταχύτητα περιορίζεται από το εύρος ζώνης της ΜΝΗΜΗΣ διαιρεμένο με το πόσο πρέπει να διαβαστεί ανά token — που εξαρτάται από το μέγεθος του μοντέλου, την αρχιτεκτονική του και τη μορφή συμπίεσης στην οποία είναι αποθηκευμένο. Η ταχύτητα ρολογιού και οι αριθμοί πυρήνων, οι αριθμοί που αναφέρει ένα φύλλο προδιαγραφών, σχεδόν δεν παίζουν ρόλο.
Πόσο ακριβείς είναι οι εκτιμήσεις σε αυτή την ιστοσελίδα;
Αναμένετε η πραγματική τιμή να κυμανθεί περίπου 20–40% της εκτίμησης. Η ίδια GPU και το μοντέλο διαφέρουν τόσο πολύ μεταξύ των μηχανών συμπερασμού, των εκδόσεων μηχανών και της ρυθμίσεως εξυπηρέτησης — καμία υπολογιστική από τα φύλλα προδιαγραφών από μόνα τους δεν μπορεί να το προβλέψει, γι' αυτό και κάθε τιμή εδώ δημοσιεύεται ως εύρος.
Είναι μια μεγαλύτερη, νεότερη GPU πάντα πιο γρήγορη για AI;
Για ένα μοντέλο που ήδη χωρά άνετα και στις δύο κάρτες, το bandwidth μνήμης αποφασίζει τον νικητή, και μια νεότερη κάρτα συνήθως έχει περισσότερα από αυτό. Αλλά το πιο κοινό bottleneck είναι η χωρητικότητα, όχι η ταχύτητα — η πιο χρήσιμη ερώτηση για μια συγκεκριμένη κάρτα είναι συνήθως "ποιο είναι το μεγαλύτερο μοντέλο που χωρά", το οποίο είναι αυτό που απαντά άμεσα η σελίδα κάθε κάρτας.
Πρέπει να καταλάβω την quantisation για να χρησιμοποιήσω αυτό το site;
Όχι — κάθε κάρτα και σελίδα μοντέλου επιλέγει τη βέλτιστη συμπίεση ποιότητας που όντως ταιριάζει, αυτόματα. Η Ποσοτικοποίηση είναι η τεχνική που μειώνει το αποτύπωμα μνήμης ενός μοντέλου με μικρό κόστος στην ποιότητα εξόδου, και μπορείς να ορίσεις μια ελάχιστη ποιότητα αν το επιθυμείς, αλλά τίποτα δεν το απαιτεί.
Από πού προέρχονται τα σύνολα δεδομένων GPU και AI μοντέλου;
Προδιαγραφές κάρτας γραφικών και αρχεία μοντέλων γλώσσας που καλύπτουν χιλιάδες open-weight μοντέλα και τους αριθμούς παραμέτρων τους, άδειες και ημερομηνίες κυκλοφορίας. Και τα δύο ανανεώνονται καθώς νέα υλικά και μοντέλα κυκλοφορούν — δείτε τους καταλόγους GPU και AI μοντέλων για πλήρη κάλυψη.
Πώληση υλικού
Ενδιαφέρεστε να γίνετε προμηθευτής;
List your GPUs for sale right next to the answer to what they can actually run..
Έρχεται σύντομα
Ενημερωθείτε για νέες GPU και μοντέλα.
Ένα ενημερωτικό δελτίο έρχεται σύντομα.
Εξερευνήστε περαιτέρω
Περιηγηθείτε στον πλήρη κατάλογο GPU ή περιηγηθείτε στον πλήρη κατάλογο AI μοντέλων. Αγοράζετε υλικό; έλεγξε τον κατάλογο προμηθευτών. Περισσότερες ερωτήσεις απαντώνται στο αρχείο μας Σελίδα Συχνών Ερωτήσεων, ή Επικοινωνήστε μαζί μας άμεσα.