2-layer-LSTM+Deep-Gradient-Compression

Κλειστές βαρύτητες Tsinghua University,Stanford University,NVIDIA 6M παράμετροι December 2017

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Tsinghua University,Stanford University,NVIDIA
Τύπος οργανισμού
Academia,Academia,Industry
Χώρα
China, United States of America
Δημοσιευμένο
5 December 2017
Συγγραφείς
Yujun Lin, Song Han, Huizi Mao, Yu Wang, William J. Dally

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling
Αριθμητική μορφή
FP32

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
6M

Here is a summary of the calculations to determine the number of parameters in the 2-layer LSTM model with Deep Gradient Compression described in the paper: Model has 2 LSTM layers with 1500 hidden units each For an LSTM layer: W matrix: number of hidden units * input dimension U matrix: number of hidden units * number of hidden units 4 bias vectors with size = number of hidden units So params per LSTM layer = hidden_units * (input_dim + hidden_units + 4) For layer 1: Input dim is word embe…

Δεδομένα εκπαίδευσης
929,000 tokens

" The warm-up period is 1 epoch out of 40 epochs"

Εποχές
40

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
1.3 × 10¹⁵ FLOP

6 FLOP / parameter / token * 6020000 parameters ['Likely' confidence] * 929000 tokens * 40 epochs = 1.3422192e+15 FLOP

Πώς ιδρύθηκε
Operation counting

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

repo, but no code for language modeling: https://github.com/synxlin/deep-gradient-compression

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Likely
Παραπομπές
1,627
Δεδομένα αναφοράς
2-layer-LSTM+Deep-Gradient-Compression

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

2-layer-LSTM+Deep-Gradient-Compression δημοσιεύθηκε από Tsinghua University,Stanford University,NVIDIA, στην χώρα καταγεγραμμένη ως China, κατά τη διάρκεια December 2017. Προέρχεται από έναν οργανισμό που κατατάσσεται ως academia,Academia,Industry.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.

Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.

Εκπαίδευση και προελεύσεις

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 1.3 × 10¹⁵ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Εκπαιδεύτηκε σε ένα σώμα περίπου 929,000 κωδικοί κειμένου

Απαντήσεις

2-layer-LSTM+Deep-Gradient-Compression — κοινές ερωτήσεις

01

2-layer-LSTM+Deep-Gradient-Compression— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

02

2-layer-LSTM+Deep-Gradient-Compression— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 6M. Here is a summary of the calculations to determine the number of parameters in the 2-layer LSTM model with Deep Gradient Compression described in the paper: Model has 2 LSTM layers with 1500 hidden units each For an LSTM layer: W matrix: number of hidden units * input dimension U matrix: number of hidden units * number of hidden units 4 bias vectors with size = number of hidden units So params per LSTM layer = hidden_units * (input_dim + hidden_units + 4) For layer 1: Input dim is word embedding size (estimated 300) Params = 1500 * (300 + 1500 + 4) = 1,512,000 For layer 2: Input is previous layer output (1500) Params = 1500 * (1500 + 1500 + 4) = 4,506,000 Total Params = Layer 1 + Layer 2 = 1,512,000 + 4,506,000 = 6,018,000 The Deep Gradient Compression technique does not change number of parameters. So total parameters for the model is approximately 6 million. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

03

2-layer-LSTM+Deep-Gradient-Compression— ποιος το δημιούργησε;

Δημοσιεύθηκε από Tsinghua University,Stanford University,NVIDIA, βασισμένο σε China, μία οργάνωση κατηγοριοποιημένη ως academia,Academia,Industry.

04

2-layer-LSTM+Deep-Gradient-Compression— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε December 2017. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

05

2-layer-LSTM+Deep-Gradient-Compression— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

06

2-layer-LSTM+Deep-Gradient-Compression— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 1.3 × 10¹⁵ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

07

2-layer-LSTM+Deep-Gradient-Compression— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 25 May 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.