Megatron-LM (8.3B)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- NVIDIA
- Τύπος οργανισμού
- Industry
- Χώρα
- United States of America
- Δημοσιευμένο
- 17 September 2019
- Συγγραφείς
- Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, Bryan Catanzaro
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling/generation
- Προσέγγιση
- Self-supervised learning
- Αριθμητική μορφή
- FP16
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 8.3B
- Δεδομένα εκπαίδευσης
- 46,400,000,000 tokens
- Εποχές
- 4.4
Source: https://lair.lighton.ai/akronomicon/ Archived source: https://web.archive.org/web/20211220142906/https://lair.lighton.ai/akronomicon/ Data also available on GitHub: https://github.com/lightonai/akronomicon/blob/main/akrodb/NVIDIA/Megatron-LM.json
"The resulting aggregate corpus contains 174 GB of deduplicated text."
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 9.1 × 10²¹ FLOP
- Πώς ιδρύθηκε
- Hardware,Operation counting,Third-party estimation
source: https://lair.lighton.ai/akronomicon/ archived: https://github.com/lightonai/akronomicon/tree/main/akrodb other estimates: 8.3B is a GPT-2-based model (Table 2). "For GPT-2 models, all training is performed with sequences of 1024 subword units at a batch size of 512 for 300k iterations" I interpret the above as 1024*512*300k = 157B training tokens 6 * 157 billion * 8.3 billion = 7.8e21 Also, their training setup achieved 15.1 petaFLOPS or 1.5e16 FLOPS. (512 V100s is 512 * 125 ter…
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA Tesla V100 DGXS 32 GB
- χρησιμοποιούμενα τσιπ
- 512
- Τσιπ-ώρες
- 167,424
- Χρόνος τοίχου
- 327 hours (13.6 days)
- Χρήση υλικού
- HFU 23.6%
- Κατανάλωση ενέργειας
- 262.6 kW
- Κόστος υπολογισμού
- $109,288
Reported throughput is 15.1 teraFLOPS per GPU on 512 GPUs Assume total compute is 9.1e21 FLOP. Then training time is 327 hours. https://www.wolframalpha.com/input?i=9.1*10%5E21+FLOP+%2F+%28512*15.1+teraFLOPS%29
Achieved 15.1 PetaFLOP/s on 512 V100s, vs theoretical maximum of 512 * 125e12 = 64 PetaFLOP/s HFU = 15.1 / 64 = 0.2359
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Open source
code (2.5B model is a GPT model): https://github.com/NVIDIA/Megatron-LM?tab=readme-ov-file#megatron-overview open license: https://github.com/NVIDIA/Megatron-LM?tab=License-1-ov-file#readme
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Μοντέλο Frontier
- Yes
- Γιατί παρακολουθείται
- Highly cited,SOTA improvement
- Εγγραφή εμπιστοσύνης
- Likely
- Παραπομπές
- 2,766
- Δεδομένα αναφοράς
- Megatron-LM (8.3B)
"Using the GPT-2 model we achieve SOTA results on the WikiText103 (10.8 compared to SOTA perplexity of 15.8) and LAMBADA" GPT-2 model here meaning model similar to GPT-2
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Από πού προήλθε
Megatron-LM (8.3B) δημοσιεύθηκε από NVIDIA, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια September 2019. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Τι χρειάστηκε για την κατασκευή του
Η εκπαιδευτική εκτέλεση καταναλώνει περίπου 9.1 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla V100 DGXS 32 GB. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Εκπαιδεύτηκε σε ένα σώμα περίπου 46,400,000,000 κωδικοί κειμένου
Το κριτήριο συμπερασμού του: highly cited,SOTA improvement.
Απαντήσεις
Megatron-LM (8.3B) — κοινές ερωτήσεις
Megatron-LM (8.3B)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε September 2019. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Megatron-LM (8.3B)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.
Megatron-LM (8.3B)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 9.1 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla V100 DGXS 32 GB. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
Megatron-LM (8.3B)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
Megatron-LM (8.3B)— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Megatron-LM (8.3B)— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 8.3B. Source: https://lair.lighton.ai/akronomicon/ Archived source: https://web.archive.org/web/20211220142906/https://lair.lighton.ai/akronomicon/ Data also available on GitHub: https://github.com/lightonai/akronomicon/blob/main/akrodb/NVIDIA/Megatron-LM.json. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
Megatron-LM (8.3B)— ποιος το δημιούργησε;
Δημοσιεύθηκε από NVIDIA, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.