TransformerXL + spectrum control
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- University of California Los Angeles (UCLA),JD.com
- Τύπος οργανισμού
- Academia,Industry
- Χώρα
- United States of America, China
- Δημοσιευμένο
- 11 March 2020
- Συγγραφείς
- Lingxiao Wang, Jing Huang, Kevin Huang, Ziniu Hu, Guangtao Wang, Quanquan Gu
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 151M
- Δεδομένα εκπαίδευσης
- 103,000,000 tokens
- Εποχές
- 250
- Μέγεθος παρτίδας
- 61,440
151M (Table 2) " On the large WikiText-103 dataset, we implement our method based on the state-of-the-art Transformer-XL based models (Dai et al., 2019). We follow the same settings reported in (Dai et al., 2019), and our implementation is based on the official code for Transformer-XL."
"For WikiText-103 dataset, we use four NVIDIA Tesla V100 GPU and set the batch size to be 40." unknown amount of epochs and training steps but they say they follow original Transformer-XL setup (400K steps + 16K warmup steps, 128 batch size, 384 sequence length) 400000*4*40*384 / 103000000 = 248 epochs
4*40*384
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 2.6 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Operation counting,Hardware
6 FLOP / parameter / token * 151000000 parameters * 103000000 tokens * 250 epochs = 2.33295e+19 FLOP 31330000000000 FLOP / sec / GPU [fp16] * 4 GPUs * 3152 sec per epoch * 250 epochs * 0.3 [assumed precision] = 2.9625648e+19 FLOP sqrt(2.33295e+19*2.9625648e+19) = 2.6289761e+19 FLOP 'speculative' confidence due to the assumption of the amount of epochs
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA V100
- χρησιμοποιούμενα τσιπ
- 4
- Χρόνος τοίχου
- 219 hours (9.1 days)
- Κατανάλωση ενέργειας
- 2.5 kW
3152 sec per epoch (Table 7) * 250 epochs / 3600 sec/hour = 219 hours
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Unreleased
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Γιατί παρακολουθείται
- SOTA improvement
- Εγγραφή εμπιστοσύνης
- Speculative
- Παραπομπές
- 90
- Δεδομένα αναφοράς
- TransformerXL + spectrum control
"We demonstrate that our spectrum control method outperforms the state-of-the-art Transformer-XL modeling for language model" " Our spectrum control method outperforms the latest state-of-the-art TransformerXL model on WikiText-103 dataset for language modeling; and obtains close to 1.5 BLEU improvement on IWSLT 2014 German-English translation task compared to the Transformer baseline model."
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Improving Neural Language Generation with Spectrum Control
- Τελευταία ενημέρωση
- 1 December 2025
Τι σημαίνουν οι αριθμοί
Σχετικά με αυτό το μοντέλο
TransformerXL + spectrum control δημοσιεύθηκε από University of California Los Angeles (UCLA),JD.com, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια March 2020. Προέρχεται από έναν οργανισμό που κατατάσσεται ως academia,Industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.
Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.
Πώς εκπαιδεύτηκε
Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 2.6 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 103,000,000 κωδικοί κειμένου
Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: sOTA improvement.
Απαντήσεις
TransformerXL + spectrum control — κοινές ερωτήσεις
TransformerXL + spectrum control— ποιος το δημιούργησε;
Δημοσιεύθηκε από University of California Los Angeles (UCLA),JD.com, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως academia,Industry.
TransformerXL + spectrum control— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε March 2020. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
TransformerXL + spectrum control— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.
TransformerXL + spectrum control— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 2.6 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
TransformerXL + spectrum control— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
TransformerXL + spectrum control— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
TransformerXL + spectrum control— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 151M. 151M (Table 2) " On the large WikiText-103 dataset, we implement our method based on the state-of-the-art Transformer-XL based models (Dai et al., 2019). We follow the same settings reported in (Dai et al., 2019), and our implementation is based on the official code for Transformer-XL.". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.