Transformer-XL Large + Phrase Induction

Κλειστές βαρύτητες Massachusetts Institute of Technology (MIT),University of Illinois Urbana-Champaign (UIUC) 257M παράμετροι June 2019

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Massachusetts Institute of Technology (MIT),University of Illinois Urbana-Champaign (UIUC)
Τύπος οργανισμού
Academia,Academia
Χώρα
United States of America
Δημοσιευμένο
4 June 2019
Συγγραφείς
Hongyin Luo, Lan Jiang, Yonatan Belinkov, James Glass

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling/generation
Βασικό μοντέλο
Transformer-XL (257M)

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
257M
Δεδομένα εκπαίδευσης
103,000,000 tokens
Εποχές
1

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
3.8 × 10²⁰ FLOP

Fine-tuned from pre-trained Transformer-XL Large (upd 3.7832771e+20 FLOP, old estimation 1.09e19 FLOP). Total: 3.7832771e20 + 1.588e17 = 3.7848651e+20 FLOP (Speculative confidence same as Transformer XL)

Πώς ιδρύθηκε
Operation counting
Ρύθμιση υπολογιστών
1.6 × 10¹⁷ FLOP

Additional 1.6e17 FLOP of fine-tuning from one epoch on WikiText-103: 6 * 257M * 103M = 1.588e17 FLOP.

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Open source

code license, BSD-3: https://github.com/luohongyin/PILM?tab=BSD-3-Clause-1-ov-file#readme training: https://github.com/luohongyin/PILM/blob/master/train_span_wt103.sh

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
SOTA improvement

"We achieved a new state-of-the-art performance of 17.4 perplexity on the Wikitext-103 dataset"

Εγγραφή εμπιστοσύνης
Speculative
Παραπομπές
14
Δεδομένα αναφοράς
Transformer-XL Large + Phrase Induction

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Improving Neural Language Models by Segmenting, Attending, and Predicting the Future
Τελευταία ενημέρωση
1 December 2025

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

Transformer-XL Large + Phrase Induction δημοσιεύθηκε από Massachusetts Institute of Technology (MIT),University of Illinois Urbana-Champaign (UIUC), στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια June 2019. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως academia,Academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation.

Βασίζεται σε Transformer-XL (257M). Γι' αυτό μοιράζεται τη γενική μορφή και μέγεθος του βασικού μοντέλου.

Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.

Εκπαίδευση και προελεύσεις

Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 3.8 × 10²⁰ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Εκπαιδεύτηκε σε ένα σώμα περίπου 103,000,000 κωδικοί κειμένου

Το κριτήριο συμπερασμού του: sOTA improvement.

Απαντήσεις

Transformer-XL Large + Phrase Induction — κοινές ερωτήσεις

01

Transformer-XL Large + Phrase Induction— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

02

Transformer-XL Large + Phrase Induction— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 257M. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

03

Transformer-XL Large + Phrase Induction— ποιος το δημιούργησε;

Δημοσιεύθηκε από Massachusetts Institute of Technology (MIT),University of Illinois Urbana-Champaign (UIUC), βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως academia,Academia.

04

Transformer-XL Large + Phrase Induction— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε June 2019. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

05

Transformer-XL Large + Phrase Induction— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.

06

Transformer-XL Large + Phrase Induction— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 3.8 × 10²⁰ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

07

Transformer-XL Large + Phrase Induction— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 1 December 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.