Υπολογίστε την TPS του Radeon Instinct MI325X σε τοπικά AI μοντέλα

AMD 256 GB HBM3e 6,000 GB/s October 2024

Κάθε μοντέλο στον κατάλογό μας αξιολογήθηκε σε σχέση με αυτή την ΚΑΡΤΑ στη διάρκεια του CONTEXT LENGTH και της ελάχιστης ποιότητας που επιλέγετε. Η ταχύτητα είναι μια εκτίμηση για ένα μόνο αίτημα, υπολογισμένη από το MEMORY BANDWIDTH αυτής της ΚΑΡΤΑΣ και το μέγεθος κάθε μοντέλου μόλις συμπιεστεί..

Υπολογίστηκε για αυτήν την κάρτα

650 μοντέλα που μπορεί να εκτελέσει

679 μοντέλα στον κατάλογό μας συνολικά

Το μεγαλύτερο μοντέλο που κρατάει

Qwen3-Coder-480B-A35B

480B · Q3_K_M · 61.9 tok/s

Ταχύτερο μοντέλο

Gemma 3 QAT 1B

1,982 tok/s · 1B

Ποια AI μοντέλα μπορούν να τρέξουν σε μια Radeon Instinct MI325X?

Ορίστε τις εισόδους, διαβάστε την απάντηση

Περισσότερα συμφραζόμενα σημαίνει περισσότερη μνήμη για την κρυφή μνήμη της συνομιλίας. Η ταχύτητα είναι για μια νέα συνομιλία και δεν αλλάζει με αυτή τη ρύθμιση..

Κρύβει μοντέλα που θα χωρούσαν μόνο αν συμπιεστούν κάτω από αυτό το σημείο.

650 τα μοντέλα ταιριάζουν

Υπολογισμός
Ποσοτικοποίηση Καλά
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

Gemma 3 1B 1B Mar 2025 1.8 GB 33k μουσικά κομμάτια Q8_0 Άνετο
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k μουσικά κομμάτια Q8_0 Άνετο
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

OLMo-1B 1B Feb 2024 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,982 tok/s

1,189–3,171 · χαμηλή εμπιστοσύνη

Pythia-1b 1B Apr 2023 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,835 tok/s

1,101–2,936 · χαμηλή εμπιστοσύνη

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,802 tok/s

1,081–2,883 · χαμηλή εμπιστοσύνη

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,802 tok/s

1,081–2,883 · χαμηλή εμπιστοσύνη

SantaCoder 1.1B Jan 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,802 tok/s

1,081–2,883 · χαμηλή εμπιστοσύνη

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,802 tok/s

1,081–2,883 · χαμηλή εμπιστοσύνη

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,652 tok/s

991–2,643 · χαμηλή εμπιστοσύνη

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,652 tok/s

991–2,643 · χαμηλή εμπιστοσύνη

MinerU2.5 1.2B Sep 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,652 tok/s

991–2,643 · χαμηλή εμπιστοσύνη

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,652 tok/s

991–2,643 · χαμηλή εμπιστοσύνη

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,611 tok/s

967–2,578 · χαμηλή εμπιστοσύνη

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k μουσικά κομμάτια Q8_0 Άνετο
1,589 tok/s

953–2,542 · χαμηλή εμπιστοσύνη

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

DigiRL 1.3B Jun 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

Otter 1.3B May 2023 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
1,525 tok/s

915–2,440 · χαμηλή εμπιστοσύνη

Phi-1 1.3B Oct 2023 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο

Οι ταχύτητες είναι εκτιμήσεις για ένα μόνο αίτημα — μία συνομιλία τη φορά — υπολογισμένες από την μνήμη, το μέγεθος του μοντέλου και την ποσοτικοποίηση. Η πραγματική διακύμανση έξοδου ποικίλλει με τον χρόνο εκτέλεσης συμπερασμάτων και την έκδοσή του. Οι αριθμοί που δημοσιεύονται από τους προμηθευτές υλικού μετρούν πολλές ταυτόχρονες αιτήσεις και είναι πολύ υψηλότεροι..

Σε καταγραφή

Radeon Instinct MI325X Πλήρης προδιαγραφή

Τα πάντα σε αρχείο για αυτήν την κάρτα, ταξινομημένα κατά πόσο σχετίζονται με τη λειτουργία ενός AI μοντέλου παρά σύμφωνα με το πώς θα το κατέγραφε ένα φύλλο προδιαγραφών. Η ΜΝΗΜΗ έρχεται πρώτη γιατί αποφασίζει το αποτέλεσμα; το υπόλοιπο είναι CONTEXT..

Μνήμη

Οι δύο προδιαγραφές που αποφασίζουν ποιο μοντέλο μπορεί να τρέξει αυτή η ΚΑΡΤΑ και με ποια ταχύτητα. Η ικανότητα καθορίζει ποια μοντέλα ταιριάζουν· το bandwidth καθορίζει πόσα tokens ανά δευτερόλεπτο παράγουν μόλις ταιριάξουν.

Μέγεθος μνήμης
256 GB
Μνήμη εύρους ζώνης
6,000 GB/s
Τύπος μνήμης
HBM3e
Πλάτος διαύλου μνήμης
8,192 bit
Ρολογιά μνήμης
1.47 GHz

Το τσιπ

Ποιος επεξεργαστής είναι πάνω στην πλακέτα και πώς κατασκευάστηκε. Ένα μικρότερο μέγεθος διαδικασίας γενικά σημαίνει περισσότερη απόδοση για την ίδια ισχύ.

Γραφικός επεξεργαστής
Aqua Vanjaram
Αρχιτεκτονική
CDNA 3.0
Γενιά
Radeon Instinct(MIx)
Μέταλλο
TSMC
Μέγεθος διαδικασίας
5 nm
Τρανζίστορ
153 billion
Πυκνότητα τρανζίστορ
150,400 K/mm²
Μέγεθος τσιπ
1,017 mm²
Πακέτο
MCM
Απελευθερώθηκε
1 October 2024

Ταχύτητες ρολογιού

Πόσο γρήγορα λειτουργεί ο επεξεργαστής. Αξίζει πολύ λιγότερο εδώ από ό,τι σε ένα gaming benchmark: η δημιουργία κειμένου περιορίζεται από το MEMORY BANDWIDTH, έτσι μια υψηλότερη συχνότητα barely moves το αποτέλεσμα.

Βασική συχνότητα
1 GHz
Ωθήσει ρολογιού
2.1 GHz

Μονάδες Επεξεργασίας

Τι περιέχει το τσιπ. Αυτά οδηγούν την απόδοση γραφικών και έχουν σημασία κυρίως για την επεξεργασία μιας μακράς προτροπής αντί για την παραγωγή της απάντησης.

Μονάδες σκίασης
19,456
Μονάδες Χαρτογράφησης Υφής
1,216
L1 κρυφή μνήμη
16 KB
L2 κρυφή μνήμη
16 MB

Θεωρητική Απόδοση

Οι κορυφαίοι ρυθμοί αριθμητικών υπολογισμών που δημοσιεύθηκαν για την κάρτα. Αυτές είναι ανώτατα όρια που καμία πραγματική εργασία δεν φτάνει, και η παραγωγή κειμένου φτάνει μόνο σε ένα μικρό ποσοστό αυτών επειδή περιορίζεται από τη μνήμη αντί για την αριθμητική.

Μισή ακρίβεια (FP16)
653.7 TFLOPS
Μονή ακρίβεια (FP32)
81.7 TFLOPS
Διπλή ακρίβεια (FP64)
81.7 TFLOPS
Ρυθμός υφής
2,554 GTexel/s

Η πλακέτα

Τι απαιτείται για να εγκαταστήσετε φυσικά και να τροφοδοτήσετε την ΚΑΡΤΑ — οι πρακτικοί περιορισμοί που αποφασίζουν αν ταιριάζει στη μηχανή που ήδη έχετε.

Κατανάλωση ενέργειας (TDP)
1,000 W
Προτεινόμενη τροφοδοσία
1,400 W
Συνδέσεις ρεύματος
None
Διασύνδεση λεωφορείου
PCIe 5.0 x16
Πλάτος υποδοχής
OAM Module

Υποστήριξη λογισμικού

Ποιες γραφικές και υπολογιστικές διεπαφές υποστηρίζει η κάρτα. Η δυνατότητα υπολογισμού CUDA είναι αυτή που επηρεάζει την εκτίμηση: κάτω από 7.0 δεν υπάρχουν πυρήνες tensor, και το σύγχρονο λογισμικό εκτίμησης επιστρέφει σε πιο αργούς κωδικούς.

OpenCL
3.0

Καταχωρίσεις

Πού να αγοράσω ένα Radeon Instinct MI325X

Κανένας προμηθευτής δεν καταχωρεί αυτήν την κάρτα αυτή τη στιγμή. Οι καταχωρίσεις προέρχονται από προμηθευτές που τις δημοσιεύουν εδώ απευθείας. — περιηγηθείτε στον κατάλογο προμηθευτών να δεις ποιος πουλάει τι.

Τι σημαίνουν οι αριθμοί

Μνήμη: η προδιαγραφή που αποφασίζει τα πάντα

Μνήμη

256 GB

Εύρος ζώνης

6,000 GB/s

Μεγαλύτερο μοντέλο

Qwen3-Coder-480B-A35B

Radeon Instinct MI325X κρατάει 256 GB του HBM3e. Αυτό το τοποθετεί στην κατηγορία υλικού που κρατά τα μεγαλύτερα OPEN WEIGHT μοντέλα χωρίς να τα διαχωρίζει σε μηχανές. Ένας χρόνος εκτέλεσης συμπερασμάτων μπορεί να φτάσει περίπου 230.4 GB.

Η μνημονική εύρος ζώνης φτάνει 6,000 GB/s πέρα από ένα λεωφορείο του 8,192 μπίτ. Αυτό είναι στην κορυφή όσων υπάρχουν. Δεδομένου ότι κάθε token σημαίνει την ανάγνωση ολόκληρου του μοντέλου από την VRAM μία φορά, μεταφράζεται σχεδόν άμεσα σε ταχύτητα παραγωγής — αυτή η κάρτα είναι αρκετά πλούσια σε bandwidth ώστε το μέγεθος του μοντέλου να σταματά να είναι ο περιοριστικός παράγοντας πολύ πριν το λεωφορείο.

Το bandwidth είναι συχνότητα επί πλάτους του λεωφορείου, και αυτή η κάρτα ρολογίζει τη μνήμη της στο 1.47 GHz. Γι’ αυτό οι μετρήσεις πυρήνων προβλέπουν την ταχύτητα της γενιάς τόσο φτωχά.

Συνολικά, το μεγαλύτερο μοντέλο που ταιριάζει είναι Qwen3-Coder-480B-A35B, 480B, συμπιεσμένο σε Q3_K_M και δημιουργώντας γύρω 61.9 tokens ανά δευτερόλεπτο

Το τσιπ και πώς κατασκευάστηκε

Radeon Instinct MI325X είναι κατασκευασμένο πάνω στον επεξεργαστή γραφικών Aqua Vanjaram, χρησιμοποιώντας την αρχιτεκτονική CDNA 3.0 από AMD, ως μέρος της γενιάς Radeon Instinct(MIx).

Το τσιπ κατασκευάζεται από TSMC, σε μια διαδικασία της 5 νμ, με ένα ζάρι που μετράει 1,017 mm², κρατώντας 153 billion Τρανζίστορ. Μια μικρότερη διαδικασία σημαίνει γενικά περισσότερη απόδοση για την ίδια ισχύ, αν και για τα γλωσσικά μοντέλα έχει πολύ λιγότερη σημασία από το υποσύστημα μνήμης.

Δημοσιεύτηκε το October 2024, χονδρικά 1.8325539040818 χρόνια πριν. Η υποστήριξη λογισμικού INFERENCE τείνει να ακολουθεί την υλικοτεχνική υποδομή κατά ένα ή δύο χρόνια, οπότε μια κάρτα αυτής της ηλικίας γενικά διαθέτει ώριμους, καλά βελτιστοποιημένους κώδικες που της είναι διαθέσιμοι.

Διαδικασία υπολογισμού, και γιατί έχει λιγότερη σημασία απ' ότι φαίνεται

FP16

653.7 TFLOPS

FP64

81.7 TFLOPS

Στο χαρτί Radeon Instinct MI325X φθάνει 653.7 TFLOPS σε μισή ακρίβεια, και 81.7 TFLOPS σε απλή ακρίβεια. Αυτά είναι κορυφαία νούμερα που κανένα πραγματικό φορτίο δεν υποστηρίζει, και η γενετική κειμένων φτάνει μόνο σε ένα μικρό ποσοστό τους - η αποκωδικοποίηση περιορίζεται από τη μνήμη παρά από την αριθμητική, γι' αυτό μια κάρτα μπορεί να φαίνεται εξαιρετικά ισχυρή εδώ και να παράγει ακόμα μικρές μονάδες με έναν κανονικό ρυθμό.

Η διάβαση διπλής ακρίβειας φθάνει 81.7 TFLOPS. Δεν έχει καμία σχέση με την εκτέλεση ενός γλωσσικού ΜΟΝΤΕΛΟΥ — κανένας χρόνος εκτέλεσης συμπερασμού δεν το χρησιμοποιεί — αλλά χωρίζει τα μέρη των κέντρων δεδομένων από τα καταναλωτικά, καθώς τα τελευταία το περιορίζουν σκόπιμα.

Οι ρολόγια τρέχουν από μια βάση του 1 GHz σε μια αύξησηของ 2.1 GHz. Αξίζει πολύ λιγότερο εδώ από ό,τι σε ένα gaming benchmark: η αύξηση των ρολογιών επιταχύνει την αριθμητική, και η αριθμητική δεν είναι αυτό που περιμένει η γενιά.

Κρυφή μνήμη και μονάδες επεξεργασίας

Radeon Instinct MI325X έχει L1 cache της 16 KB, υποστηριζόμενο από μια L2 cache του 16 MB. Η Cache απορροφά ένα μερίδιο της κίνησης μνήμης που αλλιώς θα έπληττε το κύριο λεωφορείο, το οποίο είναι το μόνο μέρος σε αυτή τη σελίδα όπου ένας αριθμός διαφορετικός από τη bandwidth επηρεάζει ήσυχα την ταχύτητα δημιουργίας - μια μεγάλη L2 επιτρέπει περισσότερα από το working set να παραμένουν κοντά στους πυρήνες.

Υπάρχουν 19,456 Μονάδες σκίασης, 1,216 Μονάδες Χαρτογράφησης Υφής. Αυτά οδηγούν τα γραφικά φορτία εργασίας και συμβάλλουν στην επεξεργασία εντολών, αλλά παραμένουν ανενεργά για μεγάλο μέρος του χρόνου που χρειάζεται ένα μοντέλο για να παράγει μια απάντηση.

Ικανότητα, μέγεθος και εγκατάσταση

Κατανάλωση ενέργειας

1,000 W

Radeon Instinct MI325X βαθμολογείται σε 1,000 W, και η προτεινόμενη τροφοδοσία συστήματος είναι 1,400 W. Η εκτέλεση ενός γλωσσικού μοντέλου κρατά μια κάρτα απασχολημένη σε εκρήξεις παρά συνεχώς — απορροφά έντονα κατά τη διαδικασία παραγωγής και αδρανεί μεταξύ των αιτημάτων — έτσι η διαρκής κατανάλωση κατά τη διάρκεια μιας εργάσιμης ημέρας είναι συνήθως πολύ κάτω από την αναγραφόμενη τιμή.

Η κάρτα καταλαμβάνει oam module. Αξίζει να ελεγχθεί σε σχέση με την περίπτωση και την τροφοδοσία που είναι ήδη στη μηχανή, καθώς οι μεγαλύτερες κάρτες χρειάζονται σημαντικά περισσότερα και από τα δύο σε σύγκριση με ό,τι παρέχει ένα τυπικό επιτραπέζιο.

Συνδέεται μέσω PCIe 5.0 x16. Η διεπαφή ρυθμίζει πόσο γρήγορα ένα μοντέλο φορτώνεται από το δίσκο στην κάρτα, όχι πόσο γρήγορα εκτελείται μόλις εκεί, έτσι μια στενότερη σύνδεση κοστίζει μερικά δευτερόλεπτα στην εκκίνηση και τίποτα μετά από αυτό.

Οι ακραίοι

Οι μεγαλύτεροι AI μοντέλα που τρέχουν σε μια Radeon Instinct MI325X

Τα μεγαλύτερα OPEN WEIGHT μοντέλα που ταιριάζουν σε αυτή την CARD, τα νεότερα πρώτα. Κάθε ένα εμφανίζεται με την καλύτερη συμπίεση που μπορεί να κρατήσει η CARD..

  1. 01 Arcee Trinity Large 398B · IQ4_XS · Feb 2026 12.2 tok/s
  2. 02 Qwen3-Coder-480B-A35B 480B · Q3_K_M · Jul 2025 61.9 tok/s
  3. 03 MiniMax-M1-80k 456B · Q3_K_M · Jun 2025 11.7 tok/s
  4. 04 MiniMax-M1-40k 456B · Q3_K_M · Jun 2025 11.7 tok/s
  5. 05 Llama 4 Maverick 400B · Q4_K_M · Apr 2025 63.6 tok/s
  6. 06 ERNIE-4.5-VL-424B-A47B (文心大模型4.5) 424B · IQ4_XS · Mar 2025 63.8 tok/s
  7. 07 Tulu 3 405B 405B · IQ4_XS · Jan 2025 12.0 tok/s
  8. 08 MiniMax-Text-01 456B · Q3_K_M · Jan 2025 11.7 tok/s
  9. 09 Hermes 3 405B 405B · IQ4_XS · Aug 2024 12.0 tok/s
  10. 10 Llama 3.1-405B 405B · Q4_K_M · Jul 2024 11.3 tok/s

Οι ταχύτεροι AI μοντέλα σε μια Radeon Instinct MI325X

Όπου αυτή η ΚΑΡΤΑ παράγει τούβλα γρηγορότερα. Μικρότερα μοντέλα κυριαρχούν εδώ, επειδή η παραγωγή κάθε τούβλου σημαίνει να διαβάζουμε ολόκληρο το μοντέλο από τη μνήμη μία φορά..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 1,982 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 1,982 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 1,982 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 1,982 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 1,982 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 1,982 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 1,835 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 1,802 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 1,802 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 1,802 tok/s

Βήμα προς βήμα

Πώς να υπολογίσετε τους TOKENS ανά ΔΕΥΤΕΡΟΛΕΠΤΟ ενός Radeon Instinct MI325X

Δεν χρειάζεται να υπολογίσετε τίποτα με το χέρι — ο υπολογιστής gputps.com σε αυτή τη σελίδα έχει ήδη υπολογίσει για κάθε μοντέλο που μπορεί να κρατήσει αυτή η κάρτα. Η ανάγνωση της απάντησης απαιτεί έξι βήματα..

  1. 01

    Μοντέλο AI που δεν χωράει σε GPU VRAM. Τεταμένη, σχεδόν εκτελέσιμη. Άνετη, τρέχει εύκολα. Ανοικτό βάρος AI μοντέλου που είναι διαθέσιμο στη βάση δεδομένων μας. Νέες GPU κυκλοφορίες. Οριακή μνήμη/δεσμευμένη μνήμη GPU VRAM/εύρος ζώνης. Κάρτα GPU. Μήκος συμφραζομένων AI.

    Ο πίνακας απαριθμεί 650 μοντέλα που διαχειρίζεται η κάρτα. Το πλαίσιο αναζήτησης δέχεται ένα όνομα ή ένα μέγεθος όπως 27b, που ταιριάζει με τον αριθμό παραμέτρων.

  2. 02

    Αποφασίστε πόσο πολύ διαρκούν οι συνομιλίες σας

    Ρυθμίστε το πλαίσιο στο πραγματικό σας μήκος εργασίας. Οι σύντομες ερωτήσεις κοστίζουν σχεδόν τίποτα, αλλά ένα μεγάλο έγγραφο μπορεί να καταναλώσει ένα μεγάλο μερίδιο από 256 GB έτσι οι ρυθμίσεις αξίζουν να γίνουν σωστά.

  3. 03

    Κλειδώστε τη σύγκριση σε ένα επίπεδο ποιότητας

    Η Συμπίεση είναι αυτό που επιτρέπει σε μεγαλύτερα μοντέλα να χωρέσουν. Ο έλεγχος ποιότητας απορρίπτει οποιοδήποτε μοντέλο χρειάζεται περισσότερη από αυτό που είστε πρόθυμοι να δώσετε.

  4. 04

    Διάβασε την ταχύτητα και την εμβέλεια

    Κάθε ταχύτητα είναι μια εκτίμηση για μια μεμονωμένη συνομιλία, με μια κλίμακα από κάτω της. Η κορυφαία τιμή εδώ είναι 1,982 τόκ/σ σε Gemma 3 QAT 1B. Η ίδια κάρτα και μοντέλο διαφέρει κατά τριάντα έως πενήντα τοις εκατό μεταξύ των χρόνων εκτέλεσης συμπερασμάτων.

  5. 05

    Διαβάστε την απόφαση καταλληλότητας τελευταία

    Σφιχτό σημαίνει ότι λειτουργεί σήμερα; Άνετο σημαίνει ότι λειτουργεί ακόμα όταν η συνομιλία μεγαλώνει. Συγκρίνετε τις ανάγκες κάθε μοντέλου με βάση το διαθέσιμο. 256 GB.

  6. 06

    Έλεγξε το ίδιο μοντέλο από την άλλη πλευρά

    Ακολουθώντας ένα μοντέλο μέχρι τη δική του σελίδα, καταγράφει όλα τα υλικά που μπορούν να το εκτελέσουν, ώστε να μπορείτε να δείτε πώς συγκρίνεται με Radeon Instinct MI325X.

Απαντήσεις

Radeon Instinct MI325X — κοινές ερωτήσεις

01

Radeon Instinct MI325X— ποιος το κατασκευάζει;

Αυτό είναι ένα προϊόν του AMD, με το τσιπ που κατασκευάστηκε από TSMC, σε μια διαδικασία της 5 νμ.

02

Radeon Instinct MI325X— πότε κυκλοφόρησε;

Δημοσιεύτηκε το October 2024.

03

Radeon Instinct MI325X— πόση ισχύς χρησιμοποιεί;

Η αξιολογούμενη ισχύς της κάρτας είναι 1,000 W, και η προτεινόμενη τροφοδοσία συστήματος είναι 1,400 W. Η δημιουργία κειμένου απαιτεί ένταση σε εκρήξεις και είναι σε κατάσταση αναμονής μεταξύ των αιτημάτων, οπότε η μέση κατανάλωση κατά τη διάρκεια μιας εργάσιμης συνεδρίας είναι κανονικά πολύ κάτω από την αξιολογούμενη τιμή.

04

Radeon Instinct MI325X— πόσο cache έχει;

Η μνήμη L1 είναι 16 KB, και η L2 cache είναι 16 MB. Η Cache απορροφά μέρος της μνήμης κυκλοφορίας που θα έφτανε αλλιώς στον κύριο διαδικτυακό κόμβο, έτσι μια μεγαλύτερη L2 δίνει μια μέτρια αύξηση στην ταχύτητα γενετικά πέρα από αυτό που προ predicts η μόνο πλά bandwidth.

05

Radeon Instinct MI325X— ποιοι είναι οι TFLOPS του;

Αξιολογείται σε 653.7 TFLOPS σε μισή ακρίβεια και 81.7 TFLOPS σε μονή ακρίβεια. Αυτά είναι αιχμές αριθμητικών ανώτατων ορίων αντί για επιτεύξιμες τιμές, και η παραγωγή κειμένου φτάνει μόνο ένα μικρό κλάσμα αυτών επειδή περιορίζεται από την μπαλαντέρ μνήμης αντί.

06

Radeon Instinct MI325X— υποστηρίζει CUDA;

Όχι. Η CUDA είναι αποκλειστική για την NVIDIA και αυτή είναι μια κάρτα από AMD. Εκτελεί τα μοντέλα γλώσσας μέσω ROCm, Vulkan ή Metal ανάλογα με το λογισμικό, τα οποία είναι λιγότερο ώριμα από την πορεία CUDA — οι εκτιμήσεις μας επιβάλλουν ποινή γι' αυτό.

07

Radeon Instinct MI325X— ποια είναι η διεπαφή bus που χρησιμοποιεί;

Χρησιμοποιεί PCIe 5.0 x16. Αυτό διέπει πόσο γρήγορα φορτώνεται ένα μοντέλο στην κάρτα αντί για το πόσο γρήγορα τρέχει μόλις φορτωθεί, οπότε κοστίζει μερικά δευτερόλεπτα κατά την εκκίνηση και τίποτα κατά τη διάρκεια της γεννήσεως.

08

Radeon Instinct MI325X— είναι καλό για να τρέξετε τοπικά AI μοντέλα;

Η μνήμη του είναι αρκετά μεγάλη για μοντέλα που οι περισσότεροι επιτραπέζιοι υπολογιστές δεν μπορούν να αγγίξουν και το εύρος ζώνης του το τοποθετεί ανάμεσα στα γρηγορότερα υλικά που είναι διαθέσιμα για παραγωγή. Συνολικά τρέχει 650 των μοντέλων που παρακολουθούμε. Εάν αυτό είναι αρκετό εξαρτάται αποκλειστικά από το ποιο μοντέλο θέλετε — ο παραπάνω πίνακας απαντά σε αυτό απευθείας.

09

Radeon Instinct MI325X— μπορεί να τρέξει ένα μοντέλο που δεν χωράει στη μνήμη του;

Φορτίο πέρα από την κάρτα 256 GB κάθονται στη μνήμη του συστήματος και λειτουργούν σε ένα κλάσμα της ταχύτητας, έτσι ένα κυρίως εκφορτωμένο μοντέλο σπάνια αξίζει να χρησιμοποιηθεί. Κάθε αριθμός εδώ υποθέτει ότι είναι πλήρως εγκατεστημένο στην κάρτα.

10

Θα μπορούσαν δύο Radeon Instinct MI325X οι κάρτες θα είναι δύο φορές πιο γρήγορες;

Όχι. Μια δεύτερη κάρτα διπλασιάζει τη μνήμη σε 512 GB συνδυασμένης μνήμης, με περίπου την ίδια ταχύτητα γενιάς όπως μία.

11

Radeon Instinct MI325X— ποια AI μοντέλα μπορεί να εκτελέσει;

650 του 679 Οι ανοιχτού τύπου γλωσσικοί μοντέλοι που παρακολουθούμε ταιριάζουν σε αυτή την κάρτα και μπορούν να εκτελούνται τοπικά. Ο πίνακας σε αυτή τη σελίδα απαριθμεί τον καθένα, με τη μνήμη που χρειάζεται, την ποσοτικοποίηση στην οποία εκτελείται και μια εκτιμώμενη ταχύτητα παραγωγής.

12

Radeon Instinct MI325X— ποιο είναι το μεγαλύτερο AI μοντέλο που μπορεί να τρέξει;

Το μεγαλύτερο μοντέλο στον κατάλογό μας που χωράει είναι Qwen3-Coder-480B-A35B σε 480B παραμέτρους, συμπιεσμένο σε Q3_K_M. Παράγει περίπου 61.9 δεσμεύσεις ανά δευτερόλεπτο και χρειάζονται περίπου 205.7 GB της μνήμης της κάρτας.

13

Radeon Instinct MI325X— πόσοι τόκεν ανά δευτερόλεπτο παράγει;

Εξαρτάται από το ΜΟΝΤΕΛΟ. Το πιο γρήγορο ΜΟΝΤΕΛΟ που παρακολουθούμε εδώ είναι Gemma 3 QAT 1B γύρω από 1,982 διακυμάνσεις ανά δευτερόλεπτο, ενώ μεγαλύτερα μοντέλα τρέχουν αναλογικά πιο αργά επειδή κάθε διακυμάνση απαιτεί την ανάγνωση ολόκληρου του μοντέλου από τη μνήμη μία φορά. Οι ταχύτητες είναι εκτιμήσεις για μία μόνο συνομιλία τη φορά.

14

Radeon Instinct MI325X— μπορεί να τρέξει 7B μοντέλα;

Ναι. Για παράδειγμα τρέχει. Multi-Token Prediction 7B σε Q8_0, χρησιμοποιώντας περίπου 7.9 GB μνήμης και δημιουργία γύρω από 296 tokens ανά δευτερόλεπτο

15

Radeon Instinct MI325X— μπορεί να τρέξει 13B μοντέλα;

Ναι. Για παράδειγμα τρέχει. DeepSeekMoE-16B σε Q8_0, χρησιμοποιώντας περίπου 17.5 GB μνήμης και δημιουργία γύρω από 688 tokens ανά δευτερόλεπτο

16

Radeon Instinct MI325X— μπορεί να τρέξει 30B μοντέλα;

Ναι. Για παράδειγμα τρέχει. ERNIE-4.5-VL-28B-A3B σε Q8_0, χρησιμοποιώντας περίπου 29.2 GB μνήμης και δημιουργία γύρω από 393 tokens ανά δευτερόλεπτο

17

Radeon Instinct MI325X— μπορεί να τρέξει 70B μοντέλα;

Ναι. Για παράδειγμα τρέχει. Qwen3-Coder-Next σε Q8_0, χρησιμοποιώντας περίπου 80.7 GB μνήμης και δημιουργία γύρω από 138 tokens ανά δευτερόλεπτο

18

Radeon Instinct MI325X— πόση μνήμη έχει;

Αυτή η GPU έχει 256 GB του HBM3e. Γύρω από το ένα δέκατο είναι δεσμευμένο από την εκτέλεση συμπερασμού και τον οδηγό, αφήνοντας περίπου 230.4 GB διαθέσιμο για ένα μοντέλο και τη συζήτησή του.

19

Radeon Instinct MI325X— ποια είναι η εύρος ζώνης μνήμης της;

Η μνημονική εύρος ζώνης φτάνει 6,000 GB/s πέρα από ένα λεωφορείο του 8,192 μπίτ. Αυτή είναι η μοναδική καλύτερη πρόβλεψη για το πόσο γρήγορα παράγει κείμενο, επειδή η παραγωγή κάθε token σημαίνει την ανάγνωση ολόκληρου του μοντέλου έξω από τη μνήμη μία φορά.

20

Radeon Instinct MI325X— ποιο τύπο μνήμης χρησιμοποιεί;

Χρησιμοποιεί HBM3e χρονισμένος σε 1.47 GHz. Οι τύποι HBM βρίσκονται σε επιταχυντές κέντρων δεδομένων και διαθέτουν πολύ περισσότερη εύρυθμη απόδοση από την GDDR που χρησιμοποιείται σε GPU καρτών επιτραπέζιου υπολογιστή, γι' αυτό και δημιουργούν tokens σημαντικά πιο γρήγορα με την ίδια χωρητικότητα.

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το υλικό. Αν ήδη ξέρετε ποιο ΜΟΝΤΕΛ θέλετε και χρειάζεστε να ξέρετε τι απαιτείται για να το ΤΡΕΞΕΤΕ., Αρχίστε από το ΜΟΝΤΕΛΟ..

Όλες οι GPUs