FFN SwiGLU

Κλειστές βαρύτητες Google 220M παράμετροι February 2020

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Google
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
14 February 2020
Συγγραφείς
Noam Shazeer

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling, Question answering

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
220M

"We use the same code base, model architecture, and training task as the base model from [Raffel et al.,2019]. The encoder and decoder each consist of 12 layers, with dmodel = 768. For the attention layers, h = 12 and dk = dv = 64. The FFN layers have hidden size df f = 3072." [Raffel et al.,2019]: "Specifically, both the encoder and decoder consist of 12 blocks (each block comprising self-attention, optional encoder-decoder attention, and a feed-forward network). The feed-forward networks in e…

Δεδομένα εκπαίδευσης
50,600,083,456 tokens

pre-training: "Identically to [Raffel et al., 2019], we pre-train for 524,288 steps on the span-filling objective on the C4 dataset. Each training batch consists of 128 examples, each of which has an input of 512 tokens and an output of 114 tokens" 524288*128*(512+114) = 42010148864 fine-tuning: "Fine-tuning consists of 131072 steps <..>, the input sequences for each step have a combined length of approximately 65,536 tokens." 131072*65536 = 8589934592 42010148864+8589934592 = 50600083456

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
3.4 × 10¹⁹ FLOP

6 FLOP/parameter/token * 220000000 parameters * 50600083456 tokens = 66792110161920000000 FLOP (10^19) 45000000000000 FLOP/GPU/sec * 21.85 hours * 3600 sec / hour * 16 GPUs * 0.3 [assumed utilization] = 16990560000000002000 FLOP (10^19) sqrt(66792110161920000000*16990560000000002000) = 3.3687317e+19

Πώς ιδρύθηκε
Hardware,Operation counting

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
Google TPU v2
χρησιμοποιούμενα τσιπ
16
Χρόνος τοίχου
22 hours

"Each training step took approximately 0.15 seconds on a 32-core TPUv2 cluster" -> 16 chips "we pre-train for 524,288 steps" 524288*0.15/3600 ~ 21.85 hours

Κατανάλωση ενέργειας
9.2 kW

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
Historical significance

the paper introduced SwiGLU

Εγγραφή εμπιστοσύνης
Confident

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
GLU Variants Improve Transformer
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

FFN SwiGLU δημοσιεύθηκε από Google, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια February 2020. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling, Question answering.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Τι χρειάστηκε για την κατασκευή του

Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 3.4 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως Google TPU v2. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 50,600,083,456 κωδικοί κειμένου

Το κριτήριο συμπερασμού του: historical significance.

Απαντήσεις

FFN SwiGLU — κοινές ερωτήσεις

01

FFN SwiGLU— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

02

FFN SwiGLU— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 220M. "We use the same code base, model architecture, and training task as the base model from [Raffel et al.,2019]. The encoder and decoder each consist of 12 layers, with dmodel = 768. For the attention layers, h = 12 and dk = dv = 64. The FFN layers have hidden size df f = 3072." [Raffel et al.,2019]: "Specifically, both the encoder and decoder consist of 12 blocks (each block comprising self-attention, optional encoder-decoder attention, and a feed-forward network). The feed-forward networks in each block consist of a dense layer with an output dimensionality of dff = 3072 followed by a ReLU nonlinearity and another dense layer. The “key” and “value” matrices of all attention mechanisms have an inner dimensionality of dkv = 64 and all attention mechanisms have 12 heads. All other sub-layers and embeddings have a dimensionality of dmodel = 768. In total, this results in a model with about 220 million parameters.". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

03

FFN SwiGLU— ποιος το δημιούργησε;

Δημοσιεύθηκε από Google, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

04

FFN SwiGLU— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε February 2020. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

05

FFN SwiGLU— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling, Question answering. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

06

FFN SwiGLU— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 3.4 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως Google TPU v2. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

07

FFN SwiGLU— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.