QRNN

Κλειστές βαρύτητες Salesforce Research 135M παράμετροι February 2018

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Salesforce Research
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
1 February 2018
Συγγραφείς
Stephen Merity, Nitish Shirish Keskar, James Bradbury, Richard Socher

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling
Αριθμητική μορφή
FP32

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
135M

Based on the details provided in the paper, the number of parameters in the QRNN model can be calculated as follows: Embedding layer size: 400 Number of QRNN layers: 4 Number of nodes per QRNN layer: 2500 Vocabulary size: 267,735 (for WikiText-103 dataset) Adaptive softmax layer Parameters: Embedding layer: 400 x 267,735 = 107,094,000 QRNN layers: Input to hidden weights per layer: 400 x 2500 = 1,000,000 Hidden to hidden weights per layer: 2500 x 2500 = 6,250,000 Biases per layer: 2500 = 2,500…

Δεδομένα εκπαίδευσης
103,000,000 tokens

"We train with a batch size of 60 and a sequence length of 140." ""Using this approach we reduce our per-epoch time substantially and achieve a new state-of-the-art on WikiText-103 despite training for 14 epochs, a total time of only 12 hours."

Εποχές
14
Μέγεθος παρτίδας
8,400

60*140

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
6.9 × 10¹⁷ FLOP

6 FLOP / parameter / token * 135000000 parameters ['Likely' confidence] * 103000000 tokens * 14 epochs = 1.16802e+18 FLOP 31330000000000 FLOP / sec / GPU [fp16 assumed] * 1 GPU * 12 hours * 3600 sec / hour * 0.3 [assumed utilization] = 4.060368e+17 FLOP sqrt(4.060368e+17*1.16802e+18) = 6.8866472e+17 FLOP

Πώς ιδρύθηκε
Operation counting,Hardware

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA V100
Χρόνος τοίχου
12 hours

"The model trains at 2980 seconds per epoch on the NVIDIA V100 and 5460 seconds per epoch on the NVIDIA P100." "Using this approach we reduce our per-epoch time substantially and achieve a new state-of-the-art on WikiText-103 despite training for 14 epochs, a total time of only 12 hours."

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
SOTA improvement

"we reduce our per-epoch time substantially and achieve a new state-of-the-art on WikiText-103 despite training for 14 epochs"

Εγγραφή εμπιστοσύνης
Likely
Παραπομπές
5
Δεδομένα αναφοράς
QRNN

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Scalable Language Modeling: WikiText-103 on a Single GPU in 12 hours
Τελευταία ενημέρωση
1 December 2025

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

QRNN δημοσιεύθηκε από Salesforce Research, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια February 2018. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι industry.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προελεύσεις

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 6.9 × 10¹⁷ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Εκπαιδεύτηκε σε ένα σώμα περίπου 103,000,000 κωδικοί κειμένου

Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: sOTA improvement.

Απαντήσεις

QRNN — κοινές ερωτήσεις

01

QRNN— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

02

QRNN— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 6.9 × 10¹⁷ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

03

QRNN— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

04

QRNN— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

05

QRNN— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 135M. Based on the details provided in the paper, the number of parameters in the QRNN model can be calculated as follows: Embedding layer size: 400 Number of QRNN layers: 4 Number of nodes per QRNN layer: 2500 Vocabulary size: 267,735 (for WikiText-103 dataset) Adaptive softmax layer Parameters: Embedding layer: 400 x 267,735 = 107,094,000 QRNN layers: Input to hidden weights per layer: 400 x 2500 = 1,000,000 Hidden to hidden weights per layer: 2500 x 2500 = 6,250,000 Biases per layer: 2500 = 2,500 Total QRNN layers parameters: 4 x (1,000,000 + 6,250,000 + 2,500) = 28,000,000 Adaptive softmax layer: No extra parameters due to weight tying Total Parameters = Embedding + QRNN layers = 107,094,000 + 28,000,000 = 135,094,000 So the total number of parameters in the QRNN model is approximately 135 million. The majority of parameters are in the embedding layer, while the 4 QRNN layers contribute 28 million parameters. The adaptive softmax does not add any extra parameters due to weight tying. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

06

QRNN— ποιος το δημιούργησε;

Δημοσιεύθηκε από Salesforce Research, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

07

QRNN— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε February 2018. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 1 December 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.