Decaying Fast Weights Transformer (WT-103)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Jenni
- Τύπος οργανισμού
- Industry
- Χώρα
- Singapore
- Δημοσιευμένο
- 9 October 2022
- Συγγραφείς
- Huanru Henry Mao
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling
- Βασικό μοντέλο
- Transformer (Adaptive Input Embeddings) WT103
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 242M
- Δεδομένα εκπαίδευσης
- 103,000,000 tokens
- Εποχές
- 192.12
"We fine-tune starting from the checkpoint provided by Baevski and Auli (2019)8, which has 242M parameters"
"For both models, we trained with a batch size of 26 for 100,000 iterations. "
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 7.9 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Hardware
- Ρύθμιση υπολογιστών
- 5.7 × 10¹⁸ FLOP
Pre-trained model is Transformer (Adaptive Input Embeddings) which was 7.3e19. This is from 8 * 67 V100-hours. fine-tuning: "Training was performed on a single NVIDIA A40 GPU for 35 hours" 35h, 1 GPU, 149.7e12, 30% = 5.7e18 FLOP" 5.7e18 + 7.3e19 is 7.9e19
"Training was performed on a single NVIDIA A40 GPU for 35 hours" 35h, 1 GPU, 149.7e12, 30% 5.7e18 FLOP"
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA A40 PCIe
- χρησιμοποιούμενα τσιπ
- 1
- Χρόνος τοίχου
- 35 hours
- Κατανάλωση ενέργειας
- 330 W
"Training was performed on a single NVIDIA A40 GPU for 35 hours."
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Unreleased
They have CUDA kernels, don't see pretrain code: https://github.com/jenni-ai/T2FW
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Confident
- Παραπομπές
- 30
- Δεδομένα αναφοράς
- Decaying Fast Weights Transformer
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Fine-Tuning Pre-trained Transformers into Decaying Fast Weights
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Από πού προήλθε
Decaying Fast Weights Transformer (WT-103) δημοσιεύθηκε από Jenni, στην χώρα καταγεγραμμένη ως Singapore, κατά τη διάρκεια October 2022. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.
Αντί να εκπαιδευτεί από την αρχή, προέρχεται από Transformer (Adaptive Input Embeddings) WT103. Οι περισσότεροι μοντέλα σε αυτή την κλίμακα προσαρμόζονται από μια υπάρχουσα βάση παρά κατασκευάζονται από το μηδέν.
Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.
Πώς εκπαιδεύτηκε
Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 7.9 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A40 PCIe. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 103,000,000 κωδικοί κειμένου
Απαντήσεις
Decaying Fast Weights Transformer (WT-103) — κοινές ερωτήσεις
Decaying Fast Weights Transformer (WT-103)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
Decaying Fast Weights Transformer (WT-103)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 7.9 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A40 PCIe. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
Decaying Fast Weights Transformer (WT-103)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
Decaying Fast Weights Transformer (WT-103)— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Decaying Fast Weights Transformer (WT-103)— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 242M. "We fine-tune starting from the checkpoint provided by Baevski and Auli (2019)8, which has 242M parameters". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
Decaying Fast Weights Transformer (WT-103)— ποιος το δημιούργησε;
Δημοσιεύθηκε από Jenni, βασισμένο σε Singapore, μία οργάνωση κατηγοριοποιημένη ως industry.
Decaying Fast Weights Transformer (WT-103)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε October 2022. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.