Qwen3-8B υπολογιστής TPS

Ανοικτά βάρη Alibaba 8.2B Παραμέτροι April 2025

Κάθε κάρτα παρακάτω αξιολογείται με βάση αυτό το μοντέλο στο μήκος συμφραζομένων και την ελάχιστη ποιότητα που επιλέγετε. Η ταχύτητα είναι μια εκτίμηση για ένα μόνο αίτημα, υπολογιζόμενη από το εύρος ζώνης μνήμης της κάρτας και το μέγεθος του μοντέλου μόλις συμπιεστεί..

Υπολογίστηκε για αυτό το μοντέλο

582 κάρτες που μπορούν να το εκτελέσουν

818 χάρτες για τους οποίους διαθέτουμε προδιαγραφές

Μικρότερη κάρτα που ταιριάζει

Quadro 6000

6 GB · Q3_K_M · 17.0 tok/s

Ταχύτερη κάρτα

B200

413 tok/s · 180 GB

Ποιες GPUs μπορούν να τρέξουν Qwen3-8B?

Ορίστε τις εισόδους, διαβάστε την απάντηση

Μια μεγαλύτερη συνομιλία απαιτεί περισσότερη μνήμη, η οποία μπορεί να αναγκάσει αυτό το μοντέλο να ξεπεράσει τις δυνατότητες μικρότερων καρτών.

Κρύβει τις κάρτες που θα ταιριάζουν μόνο στο μοντέλο, συμπιέζοντάς το κάτω από αυτό το σημείο.

582 ταυτότητα καρτών

Υπολογισμός
Ανάγκες Ποσοτικοποίηση Κατάλληλο
413 tok/s

351–496

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 10.1 GB Q8_0 Άνετο
413 tok/s

351–496

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 10.1 GB Q8_0 Άνετο
330 tok/s

198–528 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 10.1 GB Q8_0 Άνετο
330 tok/s

198–528 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 10.1 GB Q8_0 Άνετο
264 tok/s

158–422 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 10.1 GB Q8_0 Άνετο
253 tok/s

215–303

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 10.1 GB Q8_0 Άνετο
253 tok/s

215–303

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 10.1 GB Q8_0 Άνετο
242 tok/s

145–387 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 10.1 GB Q8_0 Άνετο
215 tok/s

129–343 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Άνετο
215 tok/s

129–343 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Άνετο
215 tok/s

129–343 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 10.1 GB Q8_0 Άνετο
204 tok/s

173–244

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 10.1 GB Q8_0 Άνετο
178 tok/s

151–213

CMP 170HX 8 GB NVIDIA 8 GB 1,490 GB/s Sep 2021 6.3 GB Q4_K_M Στενή
174 tok/s

148–208

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Άνετο
174 tok/s

148–208

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 10.1 GB Q8_0 Άνετο
174 tok/s

148–208

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Άνετο
174 tok/s

148–208

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Άνετο
174 tok/s

148–208

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 10.1 GB Q8_0 Άνετο
132 tok/s

79–211 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 10.1 GB Q8_0 Άνετο
132 tok/s

79–211 · χαμηλή αυτοπεποίθηση

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 10.1 GB Q8_0 Άνετο
117 tok/s

100–140

CMP 170HX 10 GB NVIDIA 10 GB 1,560 GB/s Sep 2021 8.2 GB Q6_K Στενή
110 tok/s

66–176 · χαμηλή αυτοπεποίθηση

Data Center GPU Max 1550 Intel 128 GB 3,280 GB/s Jan 2023 10.1 GB Q8_0 Άνετο
108 tok/s

65–172 · χαμηλή αυτοπεποίθηση

Data Center GPU Max Subsystem Intel 128 GB 3,210 GB/s Jan 2023 10.1 GB Q8_0 Άνετο
105 tok/s

90–126

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 10.1 GB Q8_0 Άνετο
105 tok/s

90–126

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 10.1 GB Q8_0 Άνετο

Οι ταχύτητες είναι εκτιμήσεις για ένα μόνο αίτημα — μία συνομιλία κάθε φορά — που υπολογίζονται από το εύρος ζώνης μνήμης, το μέγεθος του μοντέλου και την ποσοτικοποίηση. Ο πραγματικός ρυθμός επεξεργασίας διαφέρει με το χρόνο εκτέλεσης της inference και την έκδοσή του. Τα στοιχεία που δημοσιεύονται από τους κατασκευαστές υλικού μετρούν πολλαπλά ταυτόχρονα αιτήματα και είναι πολύ υψηλότερα.

Σε εγγραφή

Πλήρης προδιαγραφή

Όλα τα δεδομένα σχετικά με αυτό το μοντέλο. Τα περισσότερα περιγράφουν πώς εκπαιδεύτηκε παρά πώς τρέχει — χρήσιμο πλαίσιο για την αξιολόγηση του πόσο δουλειά απαιτήθηκε και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα.

Προέλευση

Ποιος δημιούργησε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε;

Οργάνωση
Alibaba
Τύπος οργάνωσης
Industry
Χώρα
China
Δημοσιευμένο
29 April 2025

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες κατασκευάστηκε το μοντέλο. Ένα μοντέλο μπορεί να περιέχει αρκετές από κάθε μία.

Τομέας
Language
Εντολή
Language modeling/generation, Question answering, Mathematical reasoning, Quantitative reasoning, Code generation, Translation

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα εκπαιδεύτηκε. Οι παράμετροι είναι το νούμερο που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

Παραμέτροι
8.2B

Number of Parameters: 8.2B Number of Paramaters (Non-Embedding): 6.95B Number of Layers: 36 Number of Attention Heads (GQA): 32 for Q and 8 for KV Context Length: 32,768 natively and 131,072 tokens with YaRN.

Δεδομένα εκπαίδευσης
tokens

36T

Εποχές
1

Υπολογιστική εκπαίδευση

Η αριθμητική που εκτελείται για την εκπαίδευση του μοντέλου, μετρημένη σε αριθμητικές πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της εκπαίδευσης, όχι πόσο γρήγορα απαντά το ολοκληρωμένο μοντέλο.

Υπολογιστική εκπαίδευση
1.8 × 10²⁴ FLOP

6 FLOP / parameter / token * 36 * 10^12 tokens * 8.2 * 10^9 parameters = 1.7712e+24 FLOP

Πώς ιδρύθηκε
Operation counting

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το εκτελέσετε στον δικό σας εξοπλισμό, κάτι που αποφασίζει αν κάποια από τα στοιχεία της κάρτας γραφικών σε αυτή τη σελίδα εφαρμόζονται.

Βάρη
Open — downloadable
Πρόσβαση μοντέλου
Open weights (unrestricted)
Κώδικας εκπαίδευσης
Unreleased

Apache 2.0 https://huggingface.co/Qwen/Qwen3-8B-Base

Hugging Face
Qwen

Πώς ταξινομείται

Ετικέτες που εφαρμόζει το πηγαίο σύνολο δεδομένων κατά την παρακολούθηση σημαντικών μοντέλων, και πόσο σίγουρο είναι για την είσοδο.

Πιθανώς πάνω από 10²³ FLOP
Yes
Καταγραφή εμπιστοσύνης
Confident

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία.

Αναφορά
Qwen3: Think Deeper, Act Faster
Τελευταία ενημέρωση
28 November 2025

Τα άκρα

Οι δέκα ταχύτερες GPU που τρέχουν Qwen3-8B

Κατατάσσονται κατά εκτιμώμενους τόκους ανά δευτερόλεπτο, η νεότερη κάρτα πρώτα όπου οι ταχύτητες ισοβαθμούν. Επειδή η γενιά περιορίζεται από το εύρος ζώνης μνήμης, αυτή η σειρά ακολουθεί το εύρος ζώνης παρά οποιοδήποτε σημείο αναφοράς παιχνιδιού..

  1. 01 B300 288 GB · 8,000 GB/s · Q8_0 413 tok/s
  2. 02 B200 180 GB · 8,000 GB/s · Q8_0 413 tok/s
  3. 03 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 330 tok/s
  4. 04 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 330 tok/s
  5. 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q8_0 264 tok/s
  6. 06 H200 NVL 141 GB · 4,890 GB/s · Q8_0 253 tok/s
  7. 07 H200 SXM 141 GB 141 GB · 4,890 GB/s · Q8_0 253 tok/s
  8. 08 Radeon Instinct MI325X 256 GB · 6,000 GB/s · Q8_0 242 tok/s
  9. 09 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q8_0 215 tok/s
  10. 10 Radeon Instinct MI300X 192 GB · 5,325 GB/s · Q8_0 215 tok/s

Τι σημαίνουν οι αριθμοί

Η πλευρά του υλικού

Ελάχιστη κάρτα

Quadro 6000

Μνήμη που απαιτείται

5.3 GB

Ταχύτερος

413 tok/s

Η Qwen3-8B είναι αρκετά μικρή με 8.2B παραμέτρους ώστε το υλικό σπάνια να είναι το εμπόδιο — 582 από τις κάρτες που παρακολουθούμε μπορούν να την εκτελέσουν, συμπεριλαμβανομένων καρτών αρκετών ετών.

Στο χαμηλό άκρο, μια Quadro 6000 το χειρίζεται — 6 GB, στο Q3_K_M, για περίπου 17.0 tokens ανά δευτερόλεπτο.

Ένα B200 είναι το πιο γρήγορο που υπολογίζουμε γι' αυτό: περίπου 413 tokens ανά δευτερόλεπτο, από 8.000 GB/s πλάτος ζώνης μνήμης.

Σχετικά με αυτό το μοντέλο

Το Qwen3-8B δημοσιεύτηκε από την Alibaba, στην Κίνα, τον Απρίλιο του 2025. Προέρχεται από τη βιομηχανία.

Λειτουργεί σε Γλώσσα, και καταγράφεται ως εκτέλεση γλωσσικής μοντελοποίησης/δημιουργίας, Απαντήσεις ερωτήσεων, Μαθηματική σκέψη, Ποσοτική σκέψη, Δημιουργία κώδικα, Μετάφραση.

Επειδή τα βάρη του έχουν απελευθερωθεί, τίποτα σχετικά με την εκτέλεσή του δεν εξαρτάται από το αν ένας πάροχος παραμένει διαθέσιμος — είναι δικό σας μόλις το κατεβάσετε. Δημοσιεύεται υπό την οργάνωση Qwen στο Hugging Face.

Πόσο γρήγορα τρέχει, και γιατί

Το μεσαίο αποτέλεσμα είναι περίπου 26,0 tokens ανά δευτερόλεπτο; 554 κάρτες παράγουν κείμενο πιο γρήγορα από ό,τι οι περισσότεροι άνθρωποι το διαβάζουν.

Κάθε βάρος συμμετέχει σε κάθε τόνου εδώ, οπότε το εύρος ζώνης είναι η όλη ιστορία: η κατάταξη παρακάτω είναι στην πραγματικότητα μια κατάταξη της ροής μνήμης.

Επειδή η αρχιτεκτονική είναι καταγεγραμμένη, η στήλη μνήμης προκύπτει αντί να εκτιμάται.

Πώς εκπαιδεύτηκε

Η παραγωγή του απαιτούσε περίπου 1.8 × 10²⁴ FLOP αριθμητικής, η οποία είναι μια δήλωση σχετικά με τον προϋπολογισμό εκπαίδευσης αντί για την παροχή συμπερασμάτων.

Βήμα προς βήμα

Πώς να επιλέξετε μια GPU για Qwen3-8B

Ο παραπάνω πίνακας έχει ήδη αξιολογήσει κάθε κάρτα που διαθέτουμε τις προδιαγραφές της σε αυτό το μοντέλο. Η προσέγγιση της απάντησής σας απαιτεί έξι βήματα..

  1. 01

    Ξεκινήστε από την στήλη μνήμης

    Ο πίνακας απαριθμεί κάθε κάρτα που μπορεί να υποστηρίξει Qwen3-8B — γύρω από 5.3 GB στα Q3_K_M. Αυτός ο αριθμός, όχι η επικεφαλής απόδοση της κάρτας, είναι αυτός που αποφασίζει αν θα τρέξει.

  2. 02

    Ταιριάξτε το πλαίσιο στη συγκεκριμένη χρήση σας

    Πιο μακρές συνομιλίες κοστίζουν μνήμη επιπλέον των αναγκών των βαρών. Μετακινήστε τον διακόπτη στο πραγματικό σας μήκος εργασίας πριν εμπιστευθείτε οποιαδήποτε σειρά για Qwen3-8B.

  3. 03

    Θέσε ένα ποιοτικό κατώφλι

    Κάθε κάρτα τρέχει την λιγότερο συμπιεσμένη έκδοση που μπορεί να κρατήσει — Q3_K_M στην μικρότερη κάρτα που χωράει. Ορισμός κατώτατου ορίου απομακρύνει τις κάρτες που διαχειρίζονται μόνο Qwen3-8B, πιέζοντας το περισσότερο από ό,τι θα θέλατε.

  4. 04

    Σύγκρινε TPS, όχι προδιαγραφές.

    Η κατάταξη κατά tokens ανά δευτερόλεπτο για Qwen3-8B ακολουθεί το εύρος ζώνης μνήμης, όχι τους αριθμούς πυρήνων, γι' αυτό το B200 το ξεπερνά με 413 tok/s.

  5. 05

    Κοίτα τον χώρο, όχι μόνο την εφαρμογή

    Μια σφιχτή εφαρμογή εκτελεί το Qwen3-8B αλλά δεν αφήνει τίποτα περιττό για μια μεγαλύτερη συνομιλία; Το άνετο έχει περιθώριο. Αν περιμένετε να αυξήσετε το πλαίσιο, αγοράστε για άνετο.

  6. 06

    Δες τι άλλο τρέχει αυτή η κάρτα

    Κάθε σελίδα κάρτας επαναλαμβάνει αυτή την εξέταση για κάθε μοντέλο που κατέχουμε. Απαντάει σε τι άλλο είναι καλός ο εξοπλισμός, πέρα από το Qwen3-8B.

Απαντήσεις

Qwen3-8B — Συχνές ερωτήσεις

01

Θα τρέξουν δύο GPUs το Qwen3-8B γρηγορότερα;

Δύο κάρτες αγοράζουν μνήμη αντί για ταχύτητα. Αυτό έχει σημασία για το Qwen3-8B μόνο αν μια κάρτα δεν μπορεί να το κρατήσει — η 582 μπορεί, έτσι μια δεύτερη προσθέτει λίγο.

02

Γιατί διαφέρει η ποσοτίσση μεταξύ καρτών για Qwen3-8B;

Κάθε κάρτα εμφανίζεται τρέχοντας την λιγότερο συμπιεσμένη έκδοση που μπορεί να κρατήσει, και το Qwen3-8B εμφανίζεται σε 4 διαφορετικά επίπεδα συμπίεσης ανάμεσα στις κάρτες που το χωράνε. Μεγαλύτερες κάρτες αποκτούν την πιο ακριβή έκδοση.

03

Πόσο ακριβείς είναι αυτές οι εκτιμήσεις ταχύτητας Qwen3-8B;

Αυτές είναι εκτιμήσεις με πραγματικά λάθη. Το ταχύτερο αποτέλεσμα εδώ, 351–496 tok/s στη B200, θα μπορούσε λογικά να βρίσκεται οπουδήποτε στη δημοσιευμένη εμβέλειά του ανάλογα με ποια εκτέλεση χρησιμοποιείτε.

04

Ποια GPU χρειάζομαι για να τρέχω το Qwen3-8B;

Η μικρότερη κάρτα στον κατάλογό μας που υποστηρίζει Qwen3-8B είναι η Quadro 6000, με 6 GB μνήμης. Εκτελεί το μοντέλο στο Q3_K_M χρησιμοποιώντας περίπου 5.3 GB, και παράγει κατά προσέγγιση 17.0 tokens ανά δευτερόλεπτο. 582 κάρτες συνολικά μπορούν να το εκτελέσουν.

05

Πόσο γρήγορο είναι το Qwen3-8B σε μια GPU;

Εξαρτάται από την κάρτα. Η πιο γρήγορη που υπολογίζουμε είναι μια B200 με περίπου 413 tokens ανά δευτερόλεπτο; η πιο αργή που εξακολουθεί να τρέχει διαχειρίζεται σημαντικά λιγότερα. Η ταχύτητα ανάγνωσης είναι γύρω από δέκα tokens ανά δευτερόλεπτο, και 554 από τις κάρτες που μπορούν να τρέξουν Qwen3-8B καθαρίζουν αυτό.

06

Πόση VRAM χρειάζεται το Qwen3-8B;

Περίπου 5,3 GB σε συμπίεση Q3_K_M, που είναι αυτό που χρησιμοποιεί η μικρότερη κάρτα που το τρέχει. Λιγότερη συμπίεση χρειάζεται περισσότερα: οι αριθμοί στην παραπάνω στήλη μνήμης ανακατανέμονται για κάθε κάρτα, διότι κάθε μία κρατά την λιγότερο συμπιεσμένη έκδοση που μπορεί.

07

Μπορώ να τρέξω τον Qwen3-8B σε μια GPU 8 GB;

Ναι. Ένα CMP 170HX 8 GB με 8 GB το εκτελεί σε Q4_K_M, χρησιμοποιώντας περίπου 6.3 GB και παράγοντας περίπου 178 tokens ανά δευτερόλεπτο — μια περιορισμένη εφαρμογή.

08

Μπορώ να τρέξω Qwen3-8B σε μια GPU 12 GB;

Ναι. Μια GeForce RTX 3080 Ti με 12 GB τρέχει το Q8_0, χρησιμοποιώντας περίπου 10.1 GB και δημιουργώντας περίπου 47.1 tokens ανά δευτερόλεπτο — μια στενή εφαρμογή.

09

Μπορώ να τρέξω Qwen3-8B σε μια GPU 16 GB;

Ναι. Ένα Tesla V100 SXM2 16 GB με 16 GB το τρέχει στο Q8_0, χρησιμοποιώντας περίπου 10.1 GB και παράγοντας περίπου 58.4 tokens ανά δευτερόλεπτο — μια άνετη εφαρμογή.

10

Μπορώ να εκτελέσω το Qwen3-8B σε μια GPU 24 GB;

Ναι. Μία GeForce RTX 5090 D V2 με 24 GB το τρέχει σε Q8_0, χρησιμοποιώντας περίπου 10.1 GB και παράγοντας περίπου 69.2 tokens ανά δευτερόλεπτο — μία άνετη εφαρμογή.

11

Είναι το Qwen3-8B ανοιχτού κώδικα;

Τα βάρη του έχουν δημοσιευθεί, επομένως το Qwen3-8B μπορεί να ληφθεί και να εκτελείται στο δικό σας υλικό. Σημειώστε ότι τα ανοιχτά βάρη δεν είναι το ίδιο με το ανοιχτό λογισμικό με την πλήρη έννοια — δεν λέει τίποτα για τα δεδομένα εκπαίδευσης, τον κώδικα εκπαίδευσης ή τους εμπορικούς όρους που συνδέονται.

12

Πόσες παραμέτρους έχει το Qwen3-8B;

Το Qwen3-8B έχει 8.2B παραμέτρους. Αριθμός Παραμέτρων: 8.2B Αριθμός Παραμέτρων (Μη-Ενσωμάτωσης): 6.95B Αριθμός Στρωμάτων: 36 Αριθμός Κεφαλών Προσοχής (GQA): 32 για Q και 8 για KV Μήκος Πλαισίου: 32,768 εγγενώς και 131,072 tokens με YaRN. Αυτός ο αριθμός είναι το σύνολο και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο — περίπου μισό gigabyte ανά δισεκατομμύριο στην συμπίεση που χρησιμοποιεί οι περισσότεροι άνθρωποι.

13

Ποιος δημιούργησε το Qwen3-8B;

Qwen3-8B δημοσιεύτηκε από την Alibaba, με έδρα την Κίνα, κατηγοριοποιημένη ως βιομηχανία.

14

Πότε κυκλοφόρησε το Qwen3-8B;

Το Qwen3-8B δημοσιεύθηκε τον Απρίλιο του 2025.

15

Τι χρησιμοποιείται το Qwen3-8B;

Το Qwen3-8B λειτουργεί στη Γλώσσα και καταγράφεται ως ικανό να διαχειρίζεται μοντελοποίηση/γεννήτρια γλώσσας, απάντηση σε ερωτήσεις, μαθηματική σκέψη, ποσοτική σκέψη, παραγωγή κώδικα, μετάφραση. Αυτές είναι οι περιοχές γύρω από τις οποίες έχει σχεδιαστεί; περιγράφουν πρόθεση παρά σκληρό όριο.

16

Πού μπορώ να κατεβάσω το Qwen3-8B;

Οι βάσεις του είναι δημοσιευμένες υπό τον οργανισμό Qwen στο Hugging Face. Δεν φιλοξενούμε αρχεία μοντέλων — αυτός ο ιστότοπος υπολογίζει ποιο υλικό χρειάζεται για να τα τρέξει.

17

Πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευση του Qwen3-8B;

Γύρω από 1.8 × 10²⁴ FLOP. Αυτό μετράει πόσο κόστισε η παραγωγή του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμού προέρχεται από τον εύρος ζώνης μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

18

Μπορώ να τρέξω το Qwen3-8B αν δεν χωράει στην GPU μου;

Μόνο με την εκφόρτωση, που συνήθως είναι μια ψευδής οικονομία: το μέρος στη μνήμη συστήματος ρίχνει όλο το πράγμα — η πλησιέστερη παράλειψη που υπολογίζουμε είναι μικρότερη κατά 1,8 GB. Οι αριθμοί μας για το Qwen3-8B υποθέτουν ότι είναι πλήρως μόνιμο.

Πηγή

Αρχική δημοσίευση

Τελευταία ενημέρωση αρχείου 28 November 2025

Η άλλη κατεύθυνση

Βλέποντάς το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινάει από το μοντέλο. Αν ήδη διαθέτετε μια κάρτα και θέλετε να γνωρίζετε όλα όσα θα τρέξει, Ξεκινήστε από το υλικό αντί..