MemSizer (language modeling)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Meta AI,Chinese University of Hong Kong (CUHK)
- Τύπος οργανισμού
- Industry,Academia
- Χώρα
- United States of America, Hong Kong
- Δημοσιευμένο
- 23 March 2022
- Συγγραφείς
- Yizhe Zhang, Deng Cai
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 357M
- Δεδομένα εκπαίδευσης
- 103,000,000 tokens
357M Table 3 "Following Kasai et al. (2021), we choose similar hyperparameters to prior work (Baevski and Auli, 2019; Fan et al., 2020): 32 layers, 8 heads, 128 head dimensions, 1024 model dimensions, 4096 fully connected dimensions and dropout (Srivastava et al., 2014) and layer dropout rates of 0.2. "
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 7.3 × 10¹⁸ FLOP
- Πώς ιδρύθηκε
- Operation counting
6 FLOP / token / parameter * 357000000 parameters * 103000000 tokens * 1 epoch [assumed for lower bound] = 2.20626e+17 FLOP also to consider: 7.3 × 10^18 FLOP SOURCE: Impute based on Baevski and Auli 2019 "We generally follow the optimization method from Baevski and Auli (2019), with a slight modification for some hyperparameters including learning rate (we use 10−4), which shows better convergence. " NOTES: Probably correct within an order of 2 or so
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Open (non-commercial)
code, no license: https://github.com/jcyk/memsizer wt103 train: https://github.com/jcyk/memsizer/blob/main/lm_wikitext-103.sh
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Likely
- Παραπομπές
- 6
- Δεδομένα αναφοράς
- MemSizer
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Linearizing Transformer with Key-Value Memory
- Τελευταία ενημέρωση
- 11 February 2026
Τι σημαίνουν οι αριθμοί
Τι είναι αυτό το μοντέλο
MemSizer (language modeling) δημοσιεύθηκε από Meta AI,Chinese University of Hong Kong (CUHK), στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια March 2022. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry,Academia.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Τι χρειάστηκε για την κατασκευή του
Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 7.3 × 10¹⁸ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 103,000,000 κωδικοί κειμένου
Απαντήσεις
MemSizer (language modeling) — κοινές ερωτήσεις
MemSizer (language modeling)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
MemSizer (language modeling)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 7.3 × 10¹⁸ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
MemSizer (language modeling)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
MemSizer (language modeling)— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
MemSizer (language modeling)— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 357M. 357M Table 3 "Following Kasai et al. (2021), we choose similar hyperparameters to prior work (Baevski and Auli, 2019; Fan et al., 2020): 32 layers, 8 heads, 128 head dimensions, 1024 model dimensions, 4096 fully connected dimensions and dropout (Srivastava et al., 2014) and layer dropout rates of 0.2. ". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
MemSizer (language modeling)— ποιος το δημιούργησε;
Δημοσιεύθηκε από Meta AI,Chinese University of Hong Kong (CUHK), βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry,Academia.
MemSizer (language modeling)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε March 2022. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.