Υπολογίστε την TPS του AeroBox GPU σε τοπικά AI μοντέλα

AMD 8 GB DDR3 68 GB/s March 2020

Κάθε μοντέλο στον κατάλογό μας αξιολογήθηκε σε σχέση με αυτή την ΚΑΡΤΑ στη διάρκεια του CONTEXT LENGTH και της ελάχιστης ποιότητας που επιλέγετε. Η ταχύτητα είναι μια εκτίμηση για ένα μόνο αίτημα, υπολογισμένη από το MEMORY BANDWIDTH αυτής της ΚΑΡΤΑΣ και το μέγεθος κάθε μοντέλου μόλις συμπιεστεί..

Υπολογίστηκε για αυτήν την κάρτα

337 μοντέλα που μπορεί να εκτελέσει

679 μοντέλα στον κατάλογό μας συνολικά

Το μεγαλύτερο μοντέλο που κρατάει

Baichuan 1-13B

13.3B · Q3_K_M · 4.6 tok/s

Ταχύτερο μοντέλο

Gemma 3 QAT 1B

22.5 tok/s · 1B

Ποια AI μοντέλα μπορούν να τρέξουν σε μια AeroBox GPU?

Ορίστε τις εισόδους, διαβάστε την απάντηση

Περισσότερα συμφραζόμενα σημαίνει περισσότερη μνήμη για την κρυφή μνήμη της συνομιλίας. Η ταχύτητα είναι για μια νέα συνομιλία και δεν αλλάζει με αυτή τη ρύθμιση..

Κρύβει μοντέλα που θα χωρούσαν μόνο αν συμπιεστούν κάτω από αυτό το σημείο.

337 τα μοντέλα ταιριάζουν

Υπολογισμός
Ποσοτικοποίηση Καλά
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

Gemma 3 1B 1B Mar 2025 1.8 GB 33k μουσικά κομμάτια Q8_0 Άνετο
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k μουσικά κομμάτια Q8_0 Άνετο
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

OLMo-1B 1B Feb 2024 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
22.5 tok/s

14–36 · χαμηλή εμπιστοσύνη

Pythia-1b 1B Apr 2023 1.8 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
20.9 tok/s

13–33 · χαμηλή εμπιστοσύνη

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
20.5 tok/s

12–33 · χαμηλή εμπιστοσύνη

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
20.5 tok/s

12–33 · χαμηλή εμπιστοσύνη

SantaCoder 1.1B Jan 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
20.5 tok/s

12–33 · χαμηλή εμπιστοσύνη

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
20.5 tok/s

12–33 · χαμηλή εμπιστοσύνη

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
18.8 tok/s

11–30 · χαμηλή εμπιστοσύνη

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
18.8 tok/s

11–30 · χαμηλή εμπιστοσύνη

MinerU2.5 1.2B Sep 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
18.8 tok/s

11–30 · χαμηλή εμπιστοσύνη

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
18.8 tok/s

11–30 · χαμηλή εμπιστοσύνη

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
18.3 tok/s

11–29 · χαμηλή εμπιστοσύνη

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k μουσικά κομμάτια Q8_0 Άνετο
18.1 tok/s

11–29 · χαμηλή εμπιστοσύνη

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

DigiRL 1.3B Jun 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

Otter 1.3B May 2023 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο
17.3 tok/s

10–28 · χαμηλή εμπιστοσύνη

Phi-1 1.3B Oct 2023 2.1 GB 131k μουσικά κομμάτια ? Q8_0 Άνετο

Οι ταχύτητες είναι εκτιμήσεις για ένα μόνο αίτημα — μία συνομιλία τη φορά — υπολογισμένες από την μνήμη, το μέγεθος του μοντέλου και την ποσοτικοποίηση. Η πραγματική διακύμανση έξοδου ποικίλλει με τον χρόνο εκτέλεσης συμπερασμάτων και την έκδοσή του. Οι αριθμοί που δημοσιεύονται από τους προμηθευτές υλικού μετρούν πολλές ταυτόχρονες αιτήσεις και είναι πολύ υψηλότεροι..

Σε καταγραφή

AeroBox GPU Πλήρης προδιαγραφή

Τα πάντα σε αρχείο για αυτήν την κάρτα, ταξινομημένα κατά πόσο σχετίζονται με τη λειτουργία ενός AI μοντέλου παρά σύμφωνα με το πώς θα το κατέγραφε ένα φύλλο προδιαγραφών. Η ΜΝΗΜΗ έρχεται πρώτη γιατί αποφασίζει το αποτέλεσμα; το υπόλοιπο είναι CONTEXT..

Μνήμη

Οι δύο προδιαγραφές που αποφασίζουν ποιο μοντέλο μπορεί να τρέξει αυτή η ΚΑΡΤΑ και με ποια ταχύτητα. Η ικανότητα καθορίζει ποια μοντέλα ταιριάζουν· το bandwidth καθορίζει πόσα tokens ανά δευτερόλεπτο παράγουν μόλις ταιριάξουν.

Μέγεθος μνήμης
8 GB
Μνήμη εύρους ζώνης
68 GB/s
Τύπος μνήμης
DDR3
Πλάτος διαύλου μνήμης
256 bit
Ρολογιά μνήμης
1.07 GHz

Το τσιπ

Ποιος επεξεργαστής είναι πάνω στην πλακέτα και πώς κατασκευάστηκε. Ένα μικρότερο μέγεθος διαδικασίας γενικά σημαίνει περισσότερη απόδοση για την ίδια ισχύ.

Γραφικός επεξεργαστής
Kryptos
Αρχιτεκτονική
GCN 1.0
Γενιά
Console GPU(Chuwi)
Μέταλλο
TSMC
Μέγεθος διαδικασίας
16 nm
Απελευθερώθηκε
13 March 2020

Ταχύτητες ρολογιού

Πόσο γρήγορα λειτουργεί ο επεξεργαστής. Αξίζει πολύ λιγότερο εδώ από ό,τι σε ένα gaming benchmark: η δημιουργία κειμένου περιορίζεται από το MEMORY BANDWIDTH, έτσι μια υψηλότερη συχνότητα barely moves το αποτέλεσμα.

Βασική συχνότητα
935 MHz
Ωθήσει ρολογιού
985 MHz

Μονάδες Επεξεργασίας

Τι περιέχει το τσιπ. Αυτά οδηγούν την απόδοση γραφικών και έχουν σημασία κυρίως για την επεξεργασία μιας μακράς προτροπής αντί για την παραγωγή της απάντησης.

Μονάδες σκίασης
896
Μονάδες Χαρτογράφησης Υφής
56
Μονάδες εξόδου απόδοσης
16

Θεωρητική Απόδοση

Οι κορυφαίοι ρυθμοί αριθμητικών υπολογισμών που δημοσιεύθηκαν για την κάρτα. Αυτές είναι ανώτατα όρια που καμία πραγματική εργασία δεν φτάνει, και η παραγωγή κειμένου φτάνει μόνο σε ένα μικρό ποσοστό αυτών επειδή περιορίζεται από τη μνήμη αντί για την αριθμητική.

Μισή ακρίβεια (FP16)
3.5 TFLOPS
Μονή ακρίβεια (FP32)
1.8 TFLOPS
Διπλή ακρίβεια (FP64)
110.3 GFLOPS
Ρυθμός εικονοστοιχείων
16 GPixel/s
Ρυθμός υφής
55 GTexel/s

Η πλακέτα

Τι απαιτείται για να εγκαταστήσετε φυσικά και να τροφοδοτήσετε την ΚΑΡΤΑ — οι πρακτικοί περιορισμοί που αποφασίζουν αν ταιριάζει στη μηχανή που ήδη έχετε.

Κατανάλωση ενέργειας (TDP)
100 W
Διαστάσεις
289 mm × 56 mm
Εμφάνιση εξόδων
1x DVI

Υποστήριξη λογισμικού

Ποιες γραφικές και υπολογιστικές διεπαφές υποστηρίζει η κάρτα. Η δυνατότητα υπολογισμού CUDA είναι αυτή που επηρεάζει την εκτίμηση: κάτω από 7.0 δεν υπάρχουν πυρήνες tensor, και το σύγχρονο λογισμικό εκτίμησης επιστρέφει σε πιο αργούς κωδικούς.

DirectX
11.1
Βούλκαν
1.2
OpenCL
1.2
Μοντέλο Σκίασης
5.1

Καταχωρίσεις

Πού να αγοράσω ένα AeroBox GPU

Κανένας προμηθευτής δεν καταχωρεί αυτήν την κάρτα αυτή τη στιγμή. Οι καταχωρίσεις προέρχονται από προμηθευτές που τις δημοσιεύουν εδώ απευθείας. — περιηγηθείτε στον κατάλογο προμηθευτών να δεις ποιος πουλάει τι.

Τι σημαίνουν οι αριθμοί

Χωρητικότητα και εύρος ζώνης

Μνήμη

8 GB

Εύρος ζώνης

68 GB/s

Μεγαλύτερο μοντέλο

Baichuan 1-13B

AeroBox GPU κρατά μόνο 8 GB του DDR3. Αυτό περιορίζει το μοντέλο στο μικρότερο άκρο του καταλόγου, και ένα μοντέλο πρέπει να χωράει ολόκληρο πριν δημιουργήσει οτιδήποτε. Ένα runtime στην πραγματικότητα παίρνει περίπου 7.2 GB.

Η μνημονική εύρος ζώνης φτάνει 68 GB/s πέρα από ένα λεωφορείο του 256 μπίτ. Η διαύγεια είναι ο πραγματικός περιορισμός αυτής της κάρτας. Κάθε τοκέν απαιτεί την ανάγνωση ολόκληρου του μοντέλου από την VRAM, οπότε ένα μεγάλο μοντέλο θα αισθάνεται αργό εδώ ακόμα και όταν χωράει.

Αυτό προέρχεται από ένα memory clock του 1.07 GHz. Διεύρυνση του λεωφορείου και αύξηση του ρολογιού είναι οι δύο μοχλοί που έχει ένας κατασκευαστής, γι' αυτό και μια κάρτα με αδιάφορους πυρήνες μπορεί ακόμα να παράγει γρήγορα.

Η πρακτική οροφή είναι Baichuan 1-13B, 13.3B, συμπιεσμένο σε Q3_K_M και δημιουργώντας γύρω 4.6 tokens ανά δευτερόλεπτο

Το τσιπ και πώς κατασκευάστηκε

AeroBox GPU είναι κατασκευασμένο πάνω στον επεξεργαστή γραφικών Kryptos, χρησιμοποιώντας την αρχιτεκτονική GCN 1.0 από AMD, ως μέρος της γενιάς Console GPU(Chuwi).

Το τσιπ κατασκευάζεται από TSMC, σε μια διαδικασία της 16 νμ. Μια μικρότερη διαδικασία σημαίνει γενικά περισσότερη απόδοση για την ίδια ισχύ, αν και για τα γλωσσικά μοντέλα έχει πολύ λιγότερη σημασία από το υποσύστημα μνήμης.

Δημοσιεύτηκε το March 2020, χονδρικά 6.3859732653575 χρόνια πριν. Η υποστήριξη λογισμικού INFERENCE τείνει να ακολουθεί την υλικοτεχνική υποδομή κατά ένα ή δύο χρόνια, οπότε μια κάρτα αυτής της ηλικίας γενικά διαθέτει ώριμους, καλά βελτιστοποιημένους κώδικες που της είναι διαθέσιμοι.

Διαδικασία υπολογισμού, και γιατί έχει λιγότερη σημασία απ' ότι φαίνεται

FP16

3.5 TFLOPS

FP64

110.3 GFLOPS

Στο χαρτί AeroBox GPU φθάνει 3.5 TFLOPS σε μισή ακρίβεια, και 1.8 TFLOPS σε απλή ακρίβεια. Αυτά είναι κορυφαία νούμερα που κανένα πραγματικό φορτίο δεν υποστηρίζει, και η γενετική κειμένων φτάνει μόνο σε ένα μικρό ποσοστό τους - η αποκωδικοποίηση περιορίζεται από τη μνήμη παρά από την αριθμητική, γι' αυτό μια κάρτα μπορεί να φαίνεται εξαιρετικά ισχυρή εδώ και να παράγει ακόμα μικρές μονάδες με έναν κανονικό ρυθμό.

Η διάβαση διπλής ακρίβειας φθάνει 110.3 GFLOPS. Δεν έχει καμία σχέση με την εκτέλεση ενός γλωσσικού ΜΟΝΤΕΛΟΥ — κανένας χρόνος εκτέλεσης συμπερασμού δεν το χρησιμοποιεί — αλλά χωρίζει τα μέρη των κέντρων δεδομένων από τα καταναλωτικά, καθώς τα τελευταία το περιορίζουν σκόπιμα.

Οι ρολόγια τρέχουν από μια βάση του 935 MHz σε μια αύξησηของ 985 MHz. Αξίζει πολύ λιγότερο εδώ από ό,τι σε ένα gaming benchmark: η αύξηση των ρολογιών επιταχύνει την αριθμητική, και η αριθμητική δεν είναι αυτό που περιμένει η γενιά.

Κρυφή μνήμη και μονάδες επεξεργασίας

Υπάρχουν 896 Μονάδες σκίασης, 56 Μονάδες Χαρτογράφησης Υφής, και 16 Μονάδες εξόδου απόδοσης. Αυτά οδηγούν τα γραφικά φορτία εργασίας και συμβάλλουν στην επεξεργασία εντολών, αλλά παραμένουν ανενεργά για μεγάλο μέρος του χρόνου που χρειάζεται ένα μοντέλο για να παράγει μια απάντηση.

Ικανότητα, μέγεθος και εγκατάσταση

Κατανάλωση ενέργειας

100 W

AeroBox GPU βαθμολογείται σε 100 W. Η εκτέλεση ενός γλωσσικού μοντέλου κρατά μια κάρτα απασχολημένη σε εκρήξεις παρά συνεχώς — απορροφά έντονα κατά τη διαδικασία παραγωγής και αδρανεί μεταξύ των αιτημάτων — έτσι η διαρκής κατανάλωση κατά τη διάρκεια μιας εργάσιμης ημέρας είναι συνήθως πολύ κάτω από την αναγραφόμενη τιμή.

μετρήσεις 289 μμ μήκους. Αξίζει να ελεγχθεί σε σχέση με την περίπτωση και την τροφοδοσία που είναι ήδη στη μηχανή, καθώς οι μεγαλύτερες κάρτες χρειάζονται σημαντικά περισσότερα και από τα δύο σε σύγκριση με ό,τι παρέχει ένα τυπικό επιτραπέζιο.

Οι ακραίοι

Οι μεγαλύτεροι AI μοντέλα που τρέχουν σε μια AeroBox GPU

Τα μεγαλύτερα OPEN WEIGHT μοντέλα που ταιριάζουν σε αυτή την CARD, τα νεότερα πρώτα. Κάθε ένα εμφανίζεται με την καλύτερη συμπίεση που μπορεί να κρατήσει η CARD..

  1. 01 OLMo 2 Furious 13B 13B · Q3_K_M · Dec 2024 4.7 tok/s
  2. 02 Cambrian-1-13B 13B · Q3_K_M · Jun 2024 4.7 tok/s
  3. 03 Fugaku-LLM 13B · Q3_K_M · May 2024 4.7 tok/s
  4. 04 OpenThaiGPT v1.0.0 (13B) 13.1B · Q3_K_M · Apr 2024 4.6 tok/s
  5. 05 Aya 13B · Q3_K_M · Feb 2024 4.7 tok/s
  6. 06 Elyza 13B · Q3_K_M · Dec 2023 4.7 tok/s
  7. 07 NexusRaven-V2 13B · Q3_K_M · Dec 2023 4.7 tok/s
  8. 08 Baize-v2-13B (白泽) 13B · Q3_K_M · Dec 2023 4.7 tok/s
  9. 09 Stockmark-13B 13.2B · Q3_K_M · Oct 2023 4.6 tok/s
  10. 10 Baichuan 1-13B 13.3B · Q3_K_M · Jul 2023 4.6 tok/s

Οι ταχύτεροι AI μοντέλα σε μια AeroBox GPU

Όπου αυτή η ΚΑΡΤΑ παράγει τούβλα γρηγορότερα. Μικρότερα μοντέλα κυριαρχούν εδώ, επειδή η παραγωγή κάθε τούβλου σημαίνει να διαβάζουμε ολόκληρο το μοντέλο από τη μνήμη μία φορά..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 22.5 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 22.5 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 22.5 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 22.5 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 22.5 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 22.5 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 20.9 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 20.5 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 20.5 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 20.5 tok/s

Βήμα προς βήμα

Πώς να υπολογίσετε τους TOKENS ανά ΔΕΥΤΕΡΟΛΕΠΤΟ ενός AeroBox GPU

Δεν χρειάζεται να υπολογίσετε τίποτα με το χέρι — ο υπολογιστής gputps.com σε αυτή τη σελίδα έχει ήδη υπολογίσει για κάθε μοντέλο που μπορεί να κρατήσει αυτή η κάρτα. Η ανάγνωση της απάντησης απαιτεί έξι βήματα..

  1. 01

    Βρείτε το μοντέλο στον πίνακα

    Ο πίνακας απαριθμεί 337 μοντέλα που διαχειρίζεται η κάρτα. Το πλαίσιο αναζήτησης δέχεται ένα όνομα ή ένα μέγεθος όπως 27b, που ταιριάζει με τον αριθμό παραμέτρων.

  2. 02

    Ορίστε το μήκος του πλαισίου (context length) που θα χρησιμοποιήσεις πραγματικά

    Σύρε τον μοχλό στο μήκος της συνομιλίας που σκοπεύεις να εργάζεσαι. Η μνήμη αυξάνεται με τη συνομιλία, και εναντίον μιας κάρτας που κρατά 8 GB συνήθως είναι αυτό που σπρώχνει ένα μεγάλο μοντέλο πάνω από την άκρη.

  3. 03

    Επιλέξτε πόσο μακριά θα συμπιέσετε

    Από προεπιλογή, ο πίνακας επιλέγει την λιγότερο συμπιεσμένη αντιγραφή που χωράει. Η ρύθμιση ενός κατωφλιού αφαιρεί τα μοντέλα που πληρούν προϋποθέσεις μόνο μέσω βαριάς συμπίεσης.

  4. 04

    Κοίτα το φάσμα, όχι μόνο τον αριθμό

    Οι ταχύτητες συνοδεύονται από γραμμές σφάλματος για κάποιον λόγο. Η καλύτερη περίπτωση εδώ είναι 22.5 τόκ/σ σε Gemma 3 QAT 1B. Η ίδια κάρτα και μοντέλο διαφέρει κατά τριάντα έως πενήντα τοις εκατό μεταξύ των χρόνων εκτέλεσης συμπερασμάτων.

  5. 05

    Έλεγξε τη στήλη μνήμης πριν δεσμεύσεις

    Η στήλη εφαρμογής χωρίζει τα μοντέλα που απλώς ταιριάζουν από αυτά που έχουν περιθώριο — αξίζει να ελεγχθεί πριν από την επιλογή ενός, σε σχέση με ένα διαθέσιμο 8 GB.

  6. 06

    Άνοιξε το μοντέλο για να συγκρίνεις τις κάρτες

    Κάθε σελίδα μοντέλου επαναλαμβάνει αυτόν τον υπολογισμό για ολόκληρο τον κατάλογο. Αξίζει μια ματιά πριν αποφασίσετε: δείχνει τι άλλο τρέχει το ίδιο μοντέλο, δίπλα σε AeroBox GPU.

Απαντήσεις

AeroBox GPU — κοινές ερωτήσεις

01

AeroBox GPU— υποστηρίζει CUDA;

Όχι. Η CUDA είναι αποκλειστική για την NVIDIA και αυτή είναι μια κάρτα από AMD. Εκτελεί τα μοντέλα γλώσσας μέσω ROCm, Vulkan ή Metal ανάλογα με το λογισμικό, τα οποία είναι λιγότερο ώριμα από την πορεία CUDA — οι εκτιμήσεις μας επιβάλλουν ποινή γι' αυτό.

02

AeroBox GPU— είναι καλό για να τρέξετε τοπικά AI μοντέλα;

Η μνήμη του περιορίζει τα μικρότερα μοντέλα, αν και το εύρος ζώνης του σημαίνει ότι η γενιά θα είναι αργή σε μεγαλύτερα μοντέλα. Στην συνολική του λειτουργία είναι 337 των μοντέλων που παρακολουθούμε. Εάν αυτό είναι αρκετό εξαρτάται αποκλειστικά από το ποιο μοντέλο θέλετε — ο παραπάνω πίνακας απαντά σε αυτό απευθείας.

03

AeroBox GPU— μπορεί να τρέξει ένα μοντέλο που δεν χωράει στη μνήμη του;

Φορτίο πέρα από την κάρτα 8 GB κάθονται στη μνήμη του συστήματος και λειτουργούν σε ένα κλάσμα της ταχύτητας, έτσι ένα κυρίως εκφορτωμένο μοντέλο σπάνια αξίζει να χρησιμοποιηθεί. Κάθε αριθμός εδώ υποθέτει ότι είναι πλήρως εγκατεστημένο στην κάρτα.

04

Θα μπορούσαν δύο AeroBox GPU οι κάρτες θα είναι δύο φορές πιο γρήγορες;

Η χωρητικότητα προστίθεται, η ροή δεν προστίθεται. Δύο από αυτά σας δίνουν 16 GB να εργάζεστε με αντί για διπλάσιο αριθμό τ tokens ανά δευτερόλεπτο — κάθε νούμερο εδώ αναφέρεται σε μία μόνο κάρτα.

05

AeroBox GPU— ποια AI μοντέλα μπορεί να εκτελέσει;

337 του 679 Οι ανοιχτού τύπου γλωσσικοί μοντέλοι που παρακολουθούμε ταιριάζουν σε αυτή την κάρτα και μπορούν να εκτελούνται τοπικά. Ο πίνακας σε αυτή τη σελίδα απαριθμεί τον καθένα, με τη μνήμη που χρειάζεται, την ποσοτικοποίηση στην οποία εκτελείται και μια εκτιμώμενη ταχύτητα παραγωγής.

06

AeroBox GPU— ποιο είναι το μεγαλύτερο AI μοντέλο που μπορεί να τρέξει;

Το μεγαλύτερο μοντέλο στον κατάλογό μας που χωράει είναι Baichuan 1-13B σε 13.3B παραμέτρους, συμπιεσμένο σε Q3_K_M. Παράγει περίπου 4.6 δεσμεύσεις ανά δευτερόλεπτο και χρειάζονται περίπου 7.2 GB της μνήμης της κάρτας.

07

AeroBox GPU— πόσοι τόκεν ανά δευτερόλεπτο παράγει;

Εξαρτάται από το ΜΟΝΤΕΛΟ. Το πιο γρήγορο ΜΟΝΤΕΛΟ που παρακολουθούμε εδώ είναι Gemma 3 QAT 1B γύρω από 22.5 διακυμάνσεις ανά δευτερόλεπτο, ενώ μεγαλύτερα μοντέλα τρέχουν αναλογικά πιο αργά επειδή κάθε διακυμάνση απαιτεί την ανάγνωση ολόκληρου του μοντέλου από τη μνήμη μία φορά. Οι ταχύτητες είναι εκτιμήσεις για μία μόνο συνομιλία τη φορά.

08

AeroBox GPU— μπορεί να τρέξει 7B μοντέλα;

Ναι. Για παράδειγμα τρέχει. MetaMath 7B (LLaMa finetune) σε Q4_K_M, χρησιμοποιώντας περίπου 6.5 GB μνήμης και δημιουργία γύρω από 7.4 tokens ανά δευτερόλεπτο

09

AeroBox GPU— μπορεί να τρέξει 13B μοντέλα;

Ναι. Για παράδειγμα τρέχει. Gemma 4 12B σε Q3_K_M, χρησιμοποιώντας περίπου 6.5 GB μνήμης και δημιουργία γύρω από 5.1 tokens ανά δευτερόλεπτο

10

AeroBox GPU— πόση μνήμη έχει;

Αυτή η GPU έχει 8 GB του DDR3. Γύρω από το ένα δέκατο είναι δεσμευμένο από την εκτέλεση συμπερασμού και τον οδηγό, αφήνοντας περίπου 7.2 GB διαθέσιμο για ένα μοντέλο και τη συζήτησή του.

11

AeroBox GPU— ποια είναι η εύρος ζώνης μνήμης της;

Η μνημονική εύρος ζώνης φτάνει 68 GB/s πέρα από ένα λεωφορείο του 256 μπίτ. Αυτή είναι η μοναδική καλύτερη πρόβλεψη για το πόσο γρήγορα παράγει κείμενο, επειδή η παραγωγή κάθε token σημαίνει την ανάγνωση ολόκληρου του μοντέλου έξω από τη μνήμη μία φορά.

12

AeroBox GPU— ποιο τύπο μνήμης χρησιμοποιεί;

Χρησιμοποιεί DDR3 χρονισμένος σε 1.07 GHz. Οι τύποι HBM βρίσκονται σε επιταχυντές κέντρων δεδομένων και διαθέτουν πολύ περισσότερη εύρυθμη απόδοση από την GDDR που χρησιμοποιείται σε GPU καρτών επιτραπέζιου υπολογιστή, γι' αυτό και δημιουργούν tokens σημαντικά πιο γρήγορα με την ίδια χωρητικότητα.

13

AeroBox GPU— ποιος το κατασκευάζει;

Αυτό είναι ένα προϊόν του AMD, με το τσιπ που κατασκευάστηκε από TSMC, σε μια διαδικασία της 16 νμ.

14

AeroBox GPU— πότε κυκλοφόρησε;

Δημοσιεύτηκε το March 2020.

15

AeroBox GPU— πόση ισχύς χρησιμοποιεί;

Η αξιολογούμενη ισχύς της κάρτας είναι 100 W. Η δημιουργία κειμένου απαιτεί ένταση σε εκρήξεις και είναι σε κατάσταση αναμονής μεταξύ των αιτημάτων, οπότε η μέση κατανάλωση κατά τη διάρκεια μιας εργάσιμης συνεδρίας είναι κανονικά πολύ κάτω από την αξιολογούμενη τιμή.

16

AeroBox GPU— ποιοι είναι οι TFLOPS του;

Αξιολογείται σε 3.5 TFLOPS σε μισή ακρίβεια και 1.8 TFLOPS σε μονή ακρίβεια. Αυτά είναι αιχμές αριθμητικών ανώτατων ορίων αντί για επιτεύξιμες τιμές, και η παραγωγή κειμένου φτάνει μόνο ένα μικρό κλάσμα αυτών επειδή περιορίζεται από την μπαλαντέρ μνήμης αντί.

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το υλικό. Αν ήδη ξέρετε ποιο ΜΟΝΤΕΛ θέλετε και χρειάζεστε να ξέρετε τι απαιτείται για να το ΤΡΕΞΕΤΕ., Αρχίστε από το ΜΟΝΤΕΛΟ..

Όλες οι GPUs