ConvS2S (ensemble of 8 models)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Meta AI
- Τύπος οργανισμού
- Industry
- Χώρα
- United States of America
- Δημοσιευμένο
- 25 July 2017
- Συγγραφείς
- Jonas Gehring, Michael Auli, David Grangier, Denis Yarats, Yann N. Dauphin
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Translation
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- Δεδομένα εκπαίδευσης
- 1,183,333,333 tokens
2.8M + 4.5M + 35.5M + 3.8M = 46.6M We consider three major WMT translation tasks as well as a text summarization task. WMT’16 English-Romanian. We use the same data and pre-processing as Sennrich et al. (2016b) but remove sentences with more than 175 words. This results in 2.8M sentence pairs for training and we evaluate on newstest2016.2 WMT’14 English-German. We use the same setup as Luong et al. (2015) which comprises 4.5M sentence pairs for training and we test on newstest2014. WMT’14 En…
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 5.6 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Hardware
All models are implemented in Torch (Collobert et al., 2011) and trained on a single Nvidia M40 GPU except for WMT’14 English-French for which we use a multi-GPU setup on a single machine. We train on up to eight GPUs synchronously by maintaining copies of the model on each card and split the batch so that each worker computes 1/8-th of the gradients; at the end we sum the gradients via Nvidia NCCL. 1. English-Romanian: "Training took between 6 and 7.5 days on a single GPU." 7 days * 24 * 3600 …
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA M40
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Γιατί παρακολουθείται
- Highly cited,SOTA improvement
- Εγγραφή εμπιστοσύνης
- Likely
"We achieve a new state of the art on several public translation benchmark data sets. On the WMT’16 EnglishRomanian task we outperform the previous best result by 1.9 BLEU, on WMT’14 English-French translation we improve over the LSTM model of Wu et al. (2016) by 1.6 BLEU in a comparable setting, and on WMT’14 EnglishGerman translation we ouperform the same model by 0.5 BLEU"
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Convolutional Sequence to Sequence Learning
- Τελευταία ενημέρωση
- 11 February 2026
Τι σημαίνουν οι αριθμοί
Τι είναι αυτό το μοντέλο
ConvS2S (ensemble of 8 models) δημοσιεύθηκε από Meta AI, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια July 2017. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του translation.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Εκπαίδευση και προελεύσεις
Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 5.6 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA M40. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 1,183,333,333 κωδικοί κειμένου
Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: highly cited,SOTA improvement.
Απαντήσεις
ConvS2S (ensemble of 8 models) — κοινές ερωτήσεις
ConvS2S (ensemble of 8 models)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε July 2017. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
ConvS2S (ensemble of 8 models)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του translation. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
ConvS2S (ensemble of 8 models)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 5.6 × 10¹⁹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA M40. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
ConvS2S (ensemble of 8 models)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
ConvS2S (ensemble of 8 models)— είναι ανοιχτού κώδικα;
Η αδειοδότηση δεν καταγράφηκε ποτέ στα πηγά μας δεδομένα. Αντιμετωπίζουμε τις μη δηλωμένες άδειες ως κλειστές, επειδή μια μη καταγεγραμμένη άδεια δεν είναι μία στην οποία μπορείς να βασιστείς.
ConvS2S (ensemble of 8 models)— πόσες παραμέτρους έχει;
Δεν έχει δημοσιευθεί αριθμός παραμέτρων γι' αυτό, γι' αυτό και δεν εμφανίζεται καμία τιμή μνήμης ή ταχύτητας σε αυτή τη σελίδα.
ConvS2S (ensemble of 8 models)— ποιος το δημιούργησε;
Δημοσιεύθηκε από Meta AI, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.