Ο κατάλογος

Υπολογιστής GPU TPS

Υπολογίστε πόσοι τόνοι ανά δευτερόλεπτο παράγει οποιαδήποτε GPU κάρτα σε ένα τοπικό AI μοντέλο. Φιλτράρετε τον κατάλογο παρακάτω για τις κάρτες που αξίζει να εξεταστούν, στη συνέχεια ανοίξτε μία για να δείτε κάθε γλώσσα μοντέλου που μπορεί να τρέξει, πόση μνήμη χρειάζεται η καθεμία και πόσο γρήγορη είναι πιθανό να είναι..

818

κάρτες σε αρχείο

4

κατασκευαστές

4 GB – 288 GB

εύρος μνήμης

8,190 GB/s

υψηλότερη εύρος ζώνης

Κάθε λέξη πρέπει να ταιριάζει σε κάτι, οπότε περισσότερες λέξεις περιορίζουν τη λίστα. Μια ικανότητα όπως 24GB ταιριάζει στη μνήμη της κάρτας, αν και καμία στήλη δεν την αποθηκεύει ως κείμενο..

818 οι κάρτες ταιριάζουν

Ενημέρωση
Τύπος μνήμης Εξουσία
B300 NVIDIA · Blackwell Ultra 288 GB 8,000 GB/s 2.03 GHz 1.67 GHz Sep 2025 HBM3e 1,400 W
Radeon Instinct MI350X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.2 GHz 1 GHz Jan 2025 HBM3e 1,000 W
Radeon Instinct MI355X AMD · CDNA 4.0 288 GB 8,190 GB/s 2.4 GHz 1 GHz Jan 2025 HBM3e 1,400 W
Radeon Instinct MI325X AMD · CDNA 3.0 256 GB 6,000 GB/s 2.1 GHz 1 GHz Oct 2024 HBM3e 1,000 W
Radeon Instinct MI300X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Radeon Instinct MI308X AMD · CDNA 3.0 192 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
B200 NVIDIA · Blackwell 180 GB 8,000 GB/s 1.97 GHz 700 MHz Jan 2024 HBM3e 1,000 W
H200 NVL NVIDIA · Hopper 141 GB 4,890 GB/s 1.79 GHz 1.37 GHz Nov 2024 HBM3e 600 W
H200 SXM 141 GB NVIDIA · Hopper 141 GB 4,890 GB/s 1.98 GHz 1.5 GHz Nov 2024 HBM3e 700 W
Data Center GPU Max 1550 Intel · Generation 12.5 128 GB 3,280 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 600 W
Data Center GPU Max Subsystem Intel · Generation 12.5 128 GB 3,210 GB/s 1.6 GHz 900 MHz Jan 2023 HBM2e 2,400 W
GB10 NVIDIA · Blackwell 2.0 128 GB 273 GB/s 2.42 GHz 1.67 GHz Oct 2025 LPDDR5X 140 W
Jetson T5000 NVIDIA · Blackwell 128 GB 273 GB/s 2.53 GHz 1.67 GHz Aug 2025 LPDDR5X 40 W
Radeon Instinct MI250 AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI250X AMD · CDNA 2.0 128 GB 3,280 GB/s 1.7 GHz 1 GHz Nov 2021 HBM2e 500 W
Radeon Instinct MI300 AMD · CDNA 3.0 128 GB 6,550 GB/s 1.7 GHz 1 GHz Jan 2023 HBM3 600 W
Radeon Instinct MI300A AMD · CDNA 3.0 128 GB 5,325 GB/s 2.1 GHz 1 GHz Dec 2023 HBM3 750 W
Data Center GPU Max 1350 Intel · Generation 12.5 96 GB 2,460 GB/s 1.55 GHz 750 MHz Jan 2023 HBM2e 450 W
H100 PCIe 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.84 GHz 1.67 GHz Mar 2023 HBM3 700 W
H100 SXM5 96 GB NVIDIA · Hopper 96 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX PRO 6000 Blackwell NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000 Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.28 GHz 1.04 GHz Mar 2025 GDDR7 300 W
RTX PRO 6000 Blackwell Server NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.62 GHz 1.59 GHz Mar 2025 GDDR7 600 W
RTX PRO 6000D Blackwell Max-Q NVIDIA · Blackwell 2.0 96 GB 1,790 GB/s 2.29 GHz 1.59 GHz Mar 2025 GDDR7 300 W
H100 NVL 94 GB NVIDIA · Hopper 94 GB 3,940 GB/s 1.79 GHz 1.08 GHz Mar 2023 HBM3 400 W
H100 SXM5 94 GB NVIDIA · Hopper 94 GB 3,360 GB/s 1.98 GHz 1.35 GHz Mar 2023 HBM3 700 W
RTX 6000D NVIDIA · Blackwell 2.0 84 GB 1,570 GB/s 2.43 GHz 1.59 GHz Mar 2025 GDDR7 600 W
A100 PCIe 80 GB NVIDIA · Ampere 80 GB 1,940 GB/s 1.41 GHz 1.07 GHz Jun 2021 HBM2e 300 W
A100 SXM4 80 GB NVIDIA · Ampere 80 GB 2,040 GB/s 1.41 GHz 1.28 GHz Nov 2020 HBM2e 400 W
A100X NVIDIA · Ampere 80 GB 2,040 GB/s 1.44 GHz 795 MHz Jun 2021 HBM2e 300 W

Βήμα προς βήμα

Πώς να υπολογίσετε το TPS της GPU σας

Τίποτα εδώ δεν χρειάζεται να επιλυθεί με το χέρι. Ο κατάλογος παραπάνω περιέχει ήδη κάθε CARD, και κάθε σελίδα CARD περιέχει ήδη κάθε MODEL που μπορεί να τρέξει με έναν αριθμό TOKENS-PER-SECOND συνδεδεμένο. Για να φτάσετε στην απάντησή σας απαιτούνται έξι βήματα..

  1. 01

    Στενέψτε τον κατάλογο σε κάρτες που αξίζει να εξεταστούν

    Χρησιμοποιήστε τα φίλτρα παρακάτω για να ορίσετε τι χρειάζεστε πραγματικά — μια ελάχιστη μέγεθος μνήμης, έναν κατασκευαστή, ένα ανώτατο όριο ισχύος που μπορεί να τροφοδοτήσει η παροχή σας ή μια χρονιά κυκλοφορίας. Η μνήμη είναι το φίλτρο για να ξεκινήσετε, διότι αποφασίζει ποια μοντέλα είναι δυνατά γενικώς.

  2. 02

    Ή αναζητήστε μια κάρτα που ήδη κατέχετε

    Πληκτρολογήστε το όνομα στο πλαίσιο αναζήτησης. Κάθε λέξη πρέπει να αντιστοιχεί σε κάτι, οπότε περισσότερες λέξεις περιορίζουν τη λίστα, και μια χωρητικότητα όπως 24GB αντιστοιχεί στη μνήμη της κάρτας, παρόλο που καμία στήλη δεν την αποθηκεύει ως κείμενο.

  3. 03

    Ταξινόμηση κατά την προδιαγραφή που καθορίζει το αποτέλεσμα σας

    Ταξινόμηση κατά VRAM αν η ερώτηση είναι ποια μοντέλα ταιριάζουν, ή κατά εύρος ζώνης αν η ερώτηση είναι πόσο γρήγορα θα τρέξουν. Οι ταχύτητες ρολογιού και οι αριθμοί πυρήνων αναφέρονται για πληρότητα αλλά επηρεάζουν ελάχιστα τη δημιουργία κειμένου.

  4. 04

    Άνοιγμα της κάρτας

    Κάθε κάρτα έχει τη δική της σελίδα που αναγράφει κάθε γλωσσικό μοντέλο που μπορεί να εκτελέσει, με εκτιμώμενους τόκους ανά δευτερόλεπτο, τη ΜΝΗΜΗ που χρειάζεται κάθε μοντέλο και τη συμπίεση στην οποία λειτουργεί.

  5. 05

    Ρυθμίστε το context length σας και την ελάχιστη ποιότητα

    Στη σελίδα της κάρτας, ορίστε τη διάρκεια της συνομιλίας που περιμένετε να εργάζεστε και τη χαμηλότερη συμπίεση που είστε διατεθειμένοι να αποδεχθείτε. Και οι δύο αλλάζουν την απάντηση αντί να τη φιλτράρουν — μια μεγαλύτερη συνομιλία χρειάζεται περισσότερη MEMORY, κάτι που μπορεί να αποβάλλει ένα μεγάλο μοντέλο από την κάρτα εντελώς.

  6. 06

    Διάβασε το εύρος, όχι τον μεμονωμένο αριθμό

    Κάθε αριθμός μέσω-put δημοσιεύεται με μια περιοχή εμπιστοσύνης γύρω του. Πάρε την περιοχή ως την απάντηση: η ίδια κάρτα και μοντέλο ποικίλλουν μεταξύ των μηχανών συμπερασμάτων και εκδόσεων με τρόπους που καμία προδιαγραφή δεν προβλέπει, και ο κύριος αριθμός είναι μόνο το μέσο αυτής της διασποράς.

Τι σημαίνουν οι αριθμοί

Τι είναι αυτός ο κατάλογος

Αυτή είναι μια βάση δεδομένων που κρατά 818 γραφικές κάρτες, φιλτραρισμένες προς αυτές με αρκετή μνήμη για να κρατήσουν ένα μοντέλο γλώσσας. Κάθε κάρτα έχει τη δική της σελίδα, και σε αυτή τη σελίδα κάθε μοντέλο που παρακολουθούμε έχει αξιολογηθεί σε σχέση με αυτή — αν ταιριάζει, με ποια συμπίεση, και πόσους τοκέν ανά δευτερόλεπτο είναι πιθανό να παράγει.

Η υπολογιστική διαδικασία εκτελείται όταν ανοίγετε μια κάρτα αντί να αναζητείται από έναν αποθηκευμένο πίνακα, το οποίο επιτρέπει το context length και την ελάχιστη ποιότητα να είναι πράγματα που ορίζετε εσείς αντί για πράγματα που υποθέσαμε εκ μέρους σας. Αλλάξτε οποιοδήποτε και κάθε αριθμό ξαναυπολογίζεται.

Γιατί οι TOKENS ανά ΔΕΥΤΕΡΟΛΕΠΤΟ είναι ο αριθμός που έχει σημασία

Η εκτέλεση ενός γλωσσικού ΜΟΝΤΕΛΟΥ πάνω στο δικό σας υλικό έγινε κάτι συνηθισμένο σε σύντομο χρονικό διάστημα. Τα ανοιχτού βάρους ΜΟΝΤΕΛΑ έφτασαν αρκετά κοντά ώστε να είναι πραγματικά χρήσιμα, και τα εργαλεία για την εκτέλεσή τους σταμάτησαν να απαιτούν υπόβαθρο έρευνας. Αυτό που δεν ήρθε παράλληλα με αυτό ήταν μια καθαρή απάντηση στην πρώτη ερώτηση που κάνει ο καθένας: θα τρέξει στην ΚΑΡΤΑ που ήδη έχω και θα είναι αρκετά γρήγορο ώστε να αξίζει να χρησιμοποιηθεί.

Οι προδιαγραφές δεν το απαντούν. Είναι γραμμένες για γραφικά φορτία εργασίας και επικεντρώνονται σε αριθμούς που καθορίζουν τα καρέ ανά δευτερόλεπτο, οι οποίοι είναι σχεδόν εξ ολοκλήρου λάθος. Οι δύο αριθμοί που πραγματικά καθορίζουν το αποτέλεσμα είναι η χωρητικότητα μνήμης, η οποία καθορίζει αν ένα μοντέλο χωράει, και η διαμεταγωγή μνήμης, η οποία καθορίζει πόσο γρήγορα παράγει μόλις χωράει.

Οι Τokens ανά δευτερόλεπτο είναι ο αριθμός που εκφράζει το αποτέλεσμα σε κάτι που μπορείς να αισθανθείς. Η ταχύτητα ανάγνωσης είναι κάπου γύρω στους δέκα TOKENS ανά δευτερόλεπτο, οπότε οτιδήποτε πάνω από αυτό φτάνει γρηγορότερα από ότι μπορείς να το διαβάσεις και οτιδήποτε χαμηλότερα αισθάνεται σαν αναμονή. Αυτός είναι ο αριθμός που υπολογίζει αυτός ο ιστότοπος, για κάθε συνδυασμό ΚΑΡΤΑΣ και ΜΟΝΤΕΛΟΥ που διαθέτει.

Τι καλύπτει ο κατάλογος

εύρος μνήμης

4 GB – 288 GB

υψηλότερη εύρος ζώνης

8,190 GB/s

Εύρος ισχύος

6 – 2,400 W

Η Μνήμη στον κατάλογο ξεκινά από 4 GB και φτάνει 288 GB. Αυτή η γκάμα είναι η διαφορά μεταξύ μιας κάρτας περιορισμένης στα μικρότερα χρησιμοποιήσιμα μοντέλα και μιας που κατέχει μοντέλα που καμία επιτραπέζια μηχανή δεν μπορεί να αγγίξει — η χωρητικότητα είναι μια σκληρή πύλη αντί για μια σταδιακή ανταλλαγή, οπότε ένα μοντέλο είτε χωράει είτε δεν τρέχει.

Η εύρος ζώνης μνήμης ξεκινά από 10 GB/s και φτάνει 8,190 GB/s, μια φιγούρα που κρατάει Radeon Instinct MI355X. Επειδή η παραγωγή κάθε token σημαίνει ότι διαβάζουμε ολόκληρο το μοντέλο από το VRAM μία φορά, αυτή η διάχυση μεταφράζεται σχεδόν απευθείας σε μια διάχυση στη ταχύτητα παραγωγής: μια κάρτα με δέκα φορές το bandwidth παράγει tokens περίπου δέκα φορές ταχύτερα στο ίδιο μοντέλο.

Οι Κάρτες στον κατάλογο κατασκευάζονται από AMD, ATI, Intel and NVIDIA. Ο κατασκευαστής έχει μεγαλύτερη σημασία από ό,τι θα έπρεπε: το λογισμικό συμπερασμού έχει λάβει πολύ περισσότερη προσοχή στην πορεία CUDA από οποιαδήποτε άλλη, οπότε μια κάρτα AMD ή Intel με ισοδύναμο εύρος ζώνης γενικά φτάνει σε ένα μικρότερο μερίδιο της θεωρητικής οροφής της. Οι εκτιμήσεις μας εφαρμόζουν μια ποινή γι' αυτό παρά να προσποιούνται ότι το υλικό είναι η μόνη μεταβλητή.

Η κατανάλωση ενέργειας ξεκινά από 6 W και φτάνει 2,400 W. Το ανώτερο άκρο είναι το υλικό κέντρου δεδομένων που μια τροφοδοσία γραφείου δεν μπορεί να τροφοδοτήσει, και είναι ο περιορισμός που οι άνθρωποι τείνουν να ανακαλύπτουν τελευταίοι — αφού η κάρτα ταιριάζει στον προϋπολογισμό και την θήκη.

Οι ημερομηνίες κυκλοφορίας ξεκινούν σε 2009 και εκτέλεση σε 2025, έτσι ο κατάλογος καλύπτει την υλικοτεχνική υποδομή που έχουν ακόμα οι άνθρωποι καθώς και την υλικοτεχνική υποδομή που μπορεί να αγοράσουν. Μια παλαιότερη κάρτα δεν αποκλείεται λόγω ηλικίας — αν διαθέτει τη μνήμη, μπορεί ακόμα να τρέξει ένα μοντέλο, και η σελίδα θα αναφέρει πόσο γρήγορα.

Αγορά μιας GPU

Οι προμηθευτές μπορούν να καταχωρήσουν κάρτες προς πώληση κατά των οποιωνδήποτε καταχωρίσεων σε αυτόν τον κατάλογο, οπότε μια σελίδα κάρτας μπορεί να δείξει τόσο το τι θα τρέξει το υλικό όσο και πού μπορεί να αγοραστεί. Οι καταχωρίσεις συνδέονται με την συγκεκριμένη παραλλαγή της κάρτας αντί με το όνομα ενός μοντέλου, το οποίο έχει περισσότερη σημασία εδώ απ' ό,τι συνήθως — το ίδιο όνομα καλύπτει συχνά πολλές χωρητικότητες μνήμης και η χωρητικότητα είναι το πράγμα που αποφασίζει ποια μοντέλα τρέχουν.

Κατατάξεις

Περισσότερη μνήμη

Η ικανότητα καθορίζει ποια μοντέλα ταιριάζουν καθόλου..

  1. 01 Radeon Instinct MI350X 288 GB
  2. 02 Radeon Instinct MI355X 288 GB
  3. 03 B300 288 GB
  4. 04 Radeon Instinct MI325X 256 GB
  5. 05 Radeon Instinct MI300X 192 GB

υψηλότερη εύρος ζώνης

Η χωρητικότητα καθορίζει πόσο γρήγορα εκκινούν μόλις ταιριάζουν..

  1. 01 Radeon Instinct MI355X 8,190 GB/s
  2. 02 Radeon Instinct MI350X 8,190 GB/s
  3. 03 B300 8,000 GB/s
  4. 04 B200 8,000 GB/s
  5. 05 Radeon Instinct MI300 6,550 GB/s

Πιο ενεργοβόρο

Έλεγχος αυτών σε σχέση με το απόθεμα που ήδη έχετε.

  1. 01 Data Center GPU Max Subsystem 2,400 W
  2. 02 Radeon Instinct MI355X 1,400 W
  3. 03 B300 1,400 W
  4. 04 Radeon Instinct MI350X 1,000 W
  5. 05 Radeon Instinct MI325X 1,000 W

Διαβάζοντας τον πίνακα

Πώς να διαβάσετε αυτόν τον κατάλογο

Μνήμη
Πόσο μπορεί να κρατήσει η κάρτα. Ένας πρόχειρος οδηγός είναι λίγο παραπάνω από μισό γιγαμπάιτ ανά δισεκατομμύριο παραμέτρους με την συμπίεση που χρησιμοποιούν οι περισσότεροι άνθρωποι, συν χώρος για τη συνομιλία. Δεν είναι διαθέσιμο όλο — το λογισμικό συμπερασμού κρατάει περίπου το ένα δέκατο για τον δικό του χώρο εργασίας.
Εύρος ζώνης
Πόσο γρήγορα η κάρτα διαβάζει τη δική της μνήμη, σε γιγαμπάιτ ανά δευτερόλεπτο. Αυτός είναι ο μόνος καλύτερος προγνωστικός παράγοντας ταχύτητας γενιάς οπουδήποτε σε αυτό το site.
Αύξηση και βασικό ρολόι
Πόσο γρήγορα τρέχει ο επεξεργαστής. Αναγράφεται για πληρότητα, και πολύ λιγότερο προγνωστικά εδώ από ότι σε έναν benchmark παιχνιδιών: η γενιά περιμένει στη μνήμη, όχι στην αριθμητική.
Τύπος μνήμης και διεπαφή λεωφορείου
Η τεχνολογία μνήμης και πώς η κάρτα συνδέεται με τη μηχανή. Τα μέρη HBM είναι υλικό κέντρου δεδομένων με πολύ περισσότερη εύρος ζώνης από την GDDR που χρησιμοποιείται σε επιτραπέζιες κάρτες. Η διεπαφή του λεωφορείου διευθύνει πόσο γρήγορα φορτίζει ένα μοντέλο, όχι πόσο γρήγορα τρέχει.
Εξουσία
Η αξιολογημένη κατανάλωση σε WATT της κάρτας. Αξίζει να φιλτραριστεί όταν η παροχή ρεύματος ή η θήκη έχουν ήδη αποφασιστεί, καθώς οι μεγαλύτερες ΚΑΡΤΕΣ χρειάζονται σημαντικά περισσότερα από όσα παρέχει μια τυπική επιφάνεια εργασίας.
Γιατί μια κάρτα εμφανίζεται περισσότερες από μία φορές
Κάθε σειρά είναι μια παραλλαγή πλακέτας αντί για ένα τσιπ, οπότε το ίδιο όνομα μπορεί να εμφανιστεί σε αρκετές χωρητικότητες μνήμης. Αυτή η διάκριση έχει σημασία εδώ περισσότερο από οπουδήποτε αλλού, επειδή η χωρητικότητα είναι αυτή που καθορίζει αν ένα μοντέλο τρέχει.

Απαντήσεις

κοινές ερωτήσεις

01

Πώς να υπολογίσω τους TOKENS ανά ΔΕΥΤΕΡΟΛΕΠΤΟ της GPU μου;

Δεν χρειάζεται να το κάνετε. Βρείτε την κάρτα σας στον πίνακα παραπάνω — ο κατάλογος περιέχει 818 τους — και το ανοίγει. Η σελίδα του παραθέτει κάθε γλωσσικό μοντέλο που μπορεί να εκτελέσει με μια εκτιμώμενη τιμή τοκεν ανά δευτερόλεπτο για κάθε ένα, υπολογισμένη από την εύρος ζώνης μνήμης της κάρτας και το μέγεθος του μοντέλου αφού συμπιεστεί.

02

Ποιο είναι ένα καλό tokens ανά δευτερόλεπτο για να τρέξει AI τοπικά;

Η ταχύτητα ανάγνωσης είναι περίπου δέκα tokens ανά δευτερόλεπτο, οπότε οτιδήποτε παραπάνω παράγει κείμενο πιο γρήγορα από ότι μπορείτε να το διαβάσετε και φαίνεται άμεσο. Ανάμεσα σε πέντε και δέκα είναι χρήσιμο αλλά αισθητά αργό. Κάτω από πέντε είναι δυσάρεστο για συνομιλία, αν και είναι ακόμα καλό για εργασία που αφήνετε να τρέχει.

03

Ποια GPU προδιαγραφή έχει τη μεγαλύτερη σημασία για την AI;

Η χωρητικότητα VRAM πρώτα, γιατί ολόκληρο το μοντέλο πρέπει να διατηρείται πάνω στην κάρτα πριν μπορέσει να παράγει οτιδήποτε, και η εύρος ζώνης δεύτερον, γιατί η παραγωγή κάθε token σημαίνει ότι διαβάζεται αυτό το μοντέλο από τη μνήμη μία φορά. Οι μετρικές πυρήνα και οι ταχύτητες ρολογιού καθορίζουν την απόδοση γραφικών και σχεδόν δεν καταγράφονται εδώ.

04

Πόση VRAM χρειάζομαι για να τρέξω ένα γλωσσικό μοντέλο;

Ως γενικός οδηγός, λίγο πάνω από μισό γιγαμπάιτ ανά δισεκατομμύριο παραμέτρους στην συμπίεση που χρησιμοποιεί το μεγαλύτερο μέρος των ανθρώπων, συν χώρος για την συνομιλία. Αυτό τοποθετεί ένα μοντέλο οκτώ δισεκατομμυρίων παραμέτρων άνετα σε οκτώ γιγαμπάιτ και ένα τριάντα δισεκατομμυρίων σε είκοσι τέσσερα. Οι κάρτες σε αυτόν τον κατάλογο αρχίζουν από 4 GB και φτάσουν 288 GB.

05

Πόσες κάρτες GPU υπάρχουν σε αυτή τη βάση δεδομένων;

Ο κατάλογος περιέχει 818 κάρτες κατασκευασμένο από AMD, ATI, Intel and NVIDIA. Οι ενσωματωμένες κάρτες γραφικών αποκλείονται επειδή δεν έχουν μνήμη δική τους, και έτσι αποκλείονται οι κάρτες κάτω από τέσσερα γιγαμπάιτ, στις οποίες κανένα μοντέλο στην καταatalog μας δεν ταιριάζει με οποιαδήποτε συμπίεση.

06

Ποια GPU έχει την υψηλότερη μνήμη/μνημονιακή ζώνη;

Αυτό είναι Radeon Instinct MI355X, φτάνοντας 8,190 GB/s. Δεδομένου ότι η ταχύτητα παραγωγής ακολουθεί σχεδόν άμεσα το bandwidth, είναι επίσης μεταξύ των ταχύτερων καρτών εδώ για την παραγωγή κειμένου - αν και αν αυτό έχει σημασία εξαρτάται πρώτα από το αν το μοντέλο σας χωράει.

07

Ποια GPU έχει την περισσότερη VRAM;

Αυτό είναι Radeon Instinct MI355X, κρατώντας 288 GB. Η χωρητικότητα σε αυτό το επίπεδο είναι έδαφος datacentre, και είναι αυτό που επιτρέπει στα μεγαλύτερα open-weight μοντέλα να κρατιούνται σε μια μόνο κάρτα αντί να χωρίζονται σε αρκετές.

08

Είναι μια κάρτα γραφικών παιχνιδιών αρκετά καλή για το τοπικό AI;

Για ένα άτομο τη φορά, συνήθως ναι, και συχνά καλύτερη αξία από το υλικό datacentre. Οι κάρτες καταναλωτών παραχωρούν συνολική μνήμη αντί για ταχύτητα, οπότε το όριο είναι ποιες μοντέλες ταιριάζουν αντί για το πόσο γρήγορα τρέχουν μόλις το κάνουν.

09

Έχει σημασία ο κατασκευαστής για την απόδοση της AI;

Περισσότερο από ό,τι θα έπρεπε. Το λογισμικό έκδοσης έχει επενδύσει πολύ περισσότερη εργασία στην διαδρομή CUDA από ότι στις εναλλακτικές, έτσι μια κάρτα AMD ή Intel με ισοδύναμο εύρος ζώνης συνήθως φτάνει σε μικρότερο μερίδιο της θεωρητικής της οροφής. Οι εκτιμήσεις μας εφαρμόζουν μια ποινή για αυτό αντί να υποθέτουμε ότι το υλικό είναι η μόνη μεταβλητή.

10

Μπορώ να χρησιμοποιήσω δύο κάρτες γραφικών μαζί;

Ναι, και αυτό είναι συχνά το σημείο — δύο κάρτες κρατούν μοντέλα που καμία δεν θα μπορούσε να κρατήσει μόνη της. Δεν διπλασιάζει την ταχύτητα γεννήσεως με τον τρόπο που διπλασιάζει τη μνήμη, και κάθε αριθμός σε αυτόν τον ιστότοπο περιγράφει μία μόνο κάρτα από μόνη της.

11

Πόσο ακριβείς είναι αυτές οι εκτιμήσεις των τοκέν ανά δευτερόλεπτο;

Υπολογίζονται από τις προδιαγραφές αντί από μετρήσεις, και κάθε μία δημοσιεύεται με μια γκάμα αντί για έναν μόνο αριθμό. Η ίδια κάρτα και μοντέλο διαφέρουν από τριάντα έως πενήντα τοις εκατό ανάλογα με το ποιο λογισμικό συμπεράσματος χρησιμοποιείτε και ποια έκδοσή του, που καμία υπολογιστική από τα φύλλα προδιαγραφών δεν μπορεί να προβλέψει. Αντιμετωπίστε την γκάμα ως την ειλικρινή απάντηση.

12

Ξέρω ποιο μοντέλο θέλω. Μπορώ να ψάξω αντίστροφα;

Ναι. Η ενότητα μοντέλων AI απαριθμεί κάθε μοντέλο που είναι ON FILE, και η σελίδα κάθε μοντέλου ονομάζει τις GPU CARDS που μπορούν να το RUN, από τις μικρότερες και ταχύτερες πρώτα. Αυτό είναι ο ίδιος υπολογισμός που προσεγγίζεται από την αντίθετη πλευρά.

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το υλικό. Αν ήδη ξέρετε ποιο ΜΟΝΤΕΛΟ θέλετε να τρέξετε και χρειάζεστε να μάθετε τι απαιτείται, ξεκινήστε από εκεί. — καταγράφει κάθε μοντέλο που είναι διαθέσιμο στη βάση δεδομένων και κάθε ένα αναφέρει τις κάρτες που μπορούν να το εκτελέσουν.

Μοντέλα AI