MoE-Multi
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Jagiellonian University,Google Brain
- Τύπος οργανισμού
- Academia,Industry
- Χώρα
- Poland, United States of America
- Δημοσιευμένο
- 23 January 2017
- Συγγραφείς
- N Shazeer, A Mirhoseini, K Maziarz, A Davis
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling, Translation
- Αριθμητική μορφή
- FP32
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 8.7B
- Δεδομένα εκπαίδευσης
- 87,000,000,000 tokens
- Εποχές
- 10
- Μέγεθος παρτίδας
- 1,365,333
Table 5 https://arxiv.org/abs/1701.06538
"We constructed a similar training set consisting of shuffled unique sentences from Google’s internal news corpus, totalling roughly 100 billion words" Assuming 100 words = 133 tokens
"Training was done synchronously on a cluster of up to 64 GPUs as described in section 3. Each training batch consisted of a set of sentence pairs containing roughly 16000 words per GPU." Although they appear to use word-level tokenization in other experiments, here they use subword tokens: "Similar to GNMT, to effectively deal with rare words, we used subword units (also known as “wordpieces") (Schuster & Nakajima, 2012) for inputs and outputs in our system." In total 64 GPUs * 16k words/GPU * …
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 9.4 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Hardware
12 days 64 NVIDIA K40 GPUs (see hardware data sheet for performance) 0.33 util rate
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA Tesla K40t
- χρησιμοποιούμενα τσιπ
- 64
- Χρόνος τοίχου
- 288 hours (12 days)
- Κατανάλωση ενέργειας
- 32.9 kW
- Κόστος υπολογισμού
- $3,874
12 days
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Γιατί παρακολουθείται
- Highly cited,SOTA improvement,Historical significance
- Εγγραφή εμπιστοσύνης
- Confident
- Παραπομπές
- 4,587
"On large language modeling and machine translation benchmarks, these models achieve significantly better results than state-of-the-art at lower computational cost"
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Σχετικά με αυτό το μοντέλο
MoE-Multi δημοσιεύθηκε από Jagiellonian University,Google Brain, στην χώρα καταγεγραμμένη ως Poland, κατά τη διάρκεια January 2017. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως academia,Industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling, Translation.
Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.
Πώς εκπαιδεύτηκε
Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 9.4 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla K40t. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 87,000,000,000 κωδικοί κειμένου
Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: highly cited,SOTA improvement,Historical significance.
Απαντήσεις
MoE-Multi — κοινές ερωτήσεις
MoE-Multi— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
MoE-Multi— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
MoE-Multi— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 8.7B. Table 5 https://arxiv.org/abs/1701.06538. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
MoE-Multi— ποιος το δημιούργησε;
Δημοσιεύθηκε από Jagiellonian University,Google Brain, βασισμένο σε Poland, μία οργάνωση κατηγοριοποιημένη ως academia,Industry.
MoE-Multi— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε January 2017. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
MoE-Multi— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling, Translation. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.
MoE-Multi— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 9.4 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla K40t. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.