All-attention network + adaptive span
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Facebook AI Research
- Τύπος οργανισμού
- Industry
- Χώρα
- United States of America, France
- Δημοσιευμένο
- 2 July 2019
- Συγγραφείς
- Sainbayar Sukhbaatar, Edouard Grave, Guillaume Lample, Herve Jegou, Armand Joulin
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling/generation
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 133M
- Δεδομένα εκπαίδευσης
- 103,000,000 tokens
- Εποχές
- 31.8
- Μέγεθος παρτίδας
- 16,384
133M (Table 3) For word level language modeling, we use a model with d = 512 and 36 layers, each with 8 heads and 2048 persistent vectors.
8k warmup steps A batch consists of 64 samples, each with 256 tokens Following Baevski and Auli [2] on WikiText-103, we use tied adaptive softmax and adaptive input with 3 clusters of size 20k, 40k and 200k assuming 200k steps: 200000*64*256/103000000 = 31.8 epochs
64*256
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 1.2 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Hardware,Operation counting
31330000000000 FLOP / sec / GPU [fp16] * 64 GPUs * 24 hours * 3600 sec/hour * 0.3 [assumed utilization] = 5.197271e+19 FLOP 6 FLOP / token / parameter * 200000 steps * 64 sequences per batch * 256 tokens per sequence * 133000000 parameters = 2.6148864e+18 FLOP sqrt(5.197271e+19*2.6148864e+18) = 1.1657733e+19 FLOP likely confidence: i am uncertain about number of steps and v100 precision _________ The Algorithmic Progress paper estimation was 4.6 × 10^19 FLOP
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA V100
- χρησιμοποιούμενα τσιπ
- 64
- Χρόνος τοίχου
- 24 hours
- Κατανάλωση ενέργειας
- 39.5 kW
"Training large models takes about a day on 64 V100 GPUs."
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Unreleased
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Likely
- Παραπομπές
- 156
- Δεδομένα αναφοράς
- All-attention network + adaptive span
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Augmenting Self-attention with Persistent Memory
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Σχετικά με αυτό το μοντέλο
All-attention network + adaptive span δημοσιεύθηκε από Facebook AI Research, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια July 2019. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Τι χρειάστηκε για την κατασκευή του
Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 1.2 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Εκπαιδεύτηκε σε ένα σώμα περίπου 103,000,000 κωδικοί κειμένου
Απαντήσεις
All-attention network + adaptive span — κοινές ερωτήσεις
All-attention network + adaptive span— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 133M. 133M (Table 3) For word level language modeling, we use a model with d = 512 and 36 layers, each with 8 heads and 2048 persistent vectors. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
All-attention network + adaptive span— ποιος το δημιούργησε;
Δημοσιεύθηκε από Facebook AI Research, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.
All-attention network + adaptive span— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε July 2019. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
All-attention network + adaptive span— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
All-attention network + adaptive span— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 1.2 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
All-attention network + adaptive span— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
All-attention network + adaptive span— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.