aLSTM(depth-2)+RecurrentPolicy (WT2)

Κλειστές βαρύτητες University of Manchester,Alan Turing Institute 32M παράμετροι May 2018

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
University of Manchester,Alan Turing Institute
Τύπος οργανισμού
Academia,Government
Χώρα
United Kingdom of Great Britain and Northern Ireland
Δημοσιευμένο
22 May 2018
Συγγραφείς
Sebastian Flennerhag, Hujun Yin, John Keane, Mark Elliot

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
32M

32M (Table 3)

Δεδομένα εκπαίδευσης
2,000,000 tokens

"Both models are trained for 10 000 steps with a batch size of 50 and a learning rate of 0.003." "Without tuning for WT2, both outperform previously published results in 150 epochs (table 3) and converge to new state of the art performance in 190 epochs"

Εποχές
190

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
7.3 × 10¹⁶ FLOP

6 FLOP / token / parameter * 32000000 parameters * 2000000 tokens * 190 epochs = 7.296e+16 FLOP

Πώς ιδρύθηκε
Operation counting

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Open source

BSD-3 license: https://github.com/flennerhag/alstm/tree/master/examples

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
SOTA improvement

"Without tuning for WT2, both outperform previously published results in 150 epochs (table 3) and converge to new state of the art performance in 190 epochs"

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
12
Δεδομένα αναφοράς
aLSTM(depth-2)+RecurrentPolicy (WT2)

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Breaking the Activation Function Bottleneck through Adaptive Parameterization
Τελευταία ενημέρωση
11 February 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

aLSTM(depth-2)+RecurrentPolicy (WT2) δημοσιεύθηκε από University of Manchester,Alan Turing Institute, στην χώρα καταγεγραμμένη ως United Kingdom of Great Britain and Northern Ireland, κατά τη διάρκεια May 2018. Προέρχεται από έναν οργανισμό που κατατάσσεται ως academia,Government.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προελεύσεις

Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 7.3 × 10¹⁶ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Εκπαιδεύτηκε σε ένα σώμα περίπου 2,000,000 κωδικοί κειμένου

Ο λόγος που εμφανίζεται σε αυτόν τον κατάλογο είναι: sOTA improvement.

Απαντήσεις

aLSTM(depth-2)+RecurrentPolicy (WT2) — κοινές ερωτήσεις

01

aLSTM(depth-2)+RecurrentPolicy (WT2)— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

02

aLSTM(depth-2)+RecurrentPolicy (WT2)— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

03

aLSTM(depth-2)+RecurrentPolicy (WT2)— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 32M. 32M (Table 3). Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

04

aLSTM(depth-2)+RecurrentPolicy (WT2)— ποιος το δημιούργησε;

Δημοσιεύθηκε από University of Manchester,Alan Turing Institute, βασισμένο σε United Kingdom of Great Britain and Northern Ireland, μία οργάνωση κατηγοριοποιημένη ως academia,Government.

05

aLSTM(depth-2)+RecurrentPolicy (WT2)— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε May 2018. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

06

aLSTM(depth-2)+RecurrentPolicy (WT2)— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

07

aLSTM(depth-2)+RecurrentPolicy (WT2)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 7.3 × 10¹⁶ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 11 February 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.