Transformer

Κλειστές βαρύτητες Google Research,Google Brain 213M παράμετροι June 2017

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Google Research,Google Brain
Τύπος οργανισμού
Industry,Industry
Χώρα
United States of America
Δημοσιευμένο
12 June 2017
Συγγραφείς
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Translation
Προσέγγιση
Self-supervised learning
Αριθμητική μορφή
FP32

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
213M

This page suggests the transformer has 213M parameters. "Although there are others architectures that make use of attention layers, none achieves so good results so fast. Not only that, but the only model that can compite against Transformer is the Slicenet22, proposed just fifteen days before. It takes much longer to train, due to the huge amount of parameters it requires (348 million against the 213 millions of Transformer), and the BLEU scores it achieves are slightly worse on average. In sh…

Δεδομένα εκπαίδευσης
832,000,000 tokens

"We trained on the standard WMT 2014 English-German dataset consisting of about 4.5 million sentence pairs. Sentences were encoded using byte-pair encoding [3], which has a shared source-target vocabulary of about 37000 tokens. For English-French, we used the significantly larger WMT 2014 English-French dataset consisting of 36M sentences and split tokens into a 32000 word-piece vocabulary " In total, this is 40.5 million sentence-pairs. Assuming each sentence pair is 15-20 words in each langua…

Εποχές
3

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
7.4 × 10¹⁸ FLOP

"The model was trained during 300000 steps, roughly 3.5 days, using 8 NVIDIA P100 GPUs." source: https://ricardokleinklein.github.io/2017/11/16/Attention-is-all-you-need.html NVIDIA Tesla P100 has 9.3 teraFLOPS single-precision performance source: https://www.nvidia.com/en-gb/data-center/tesla-p100/ We assume 0.33 utilization performance, in line with OpenAI's "AI and compute" article source: https://openai.com/blog/ai-and-compute/ 9.3*10^12 FLOP / GPU / sec * 8 GPUs * 3.5 days * 24 hour /…

Πώς ιδρύθηκε
Hardware,Third-party estimation

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA P100
χρησιμοποιούμενα τσιπ
8
Τσιπ-ώρες
672
Χρόνος τοίχου
84 hours

We trained our models on one machine with 8 NVIDIA P100 GPUs. For our base models using the hyperparameters described throughout the paper, each training step took about 0.4 seconds. We trained the base models for a total of 100,000 steps or 12 hours. For our big models,(described on the bottom line of table 3), step time was 1.0 seconds. The big models were trained for 300,000 steps (3.5 days).

Κατανάλωση ενέργειας
4.2 kW
Κόστος υπολογισμού
$438

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
Highly cited,Historical significance

The original transformer

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
159,251

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Attention Is All You Need
Τελευταία ενημέρωση
1 January 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

Transformer δημοσιεύθηκε από Google Research,Google Brain, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια June 2017. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry,Industry.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του translation.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προελεύσεις

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 7.4 × 10¹⁸ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA P100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 832,000,000 κωδικοί κειμένου

Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: highly cited,Historical significance.

Απαντήσεις

Transformer — κοινές ερωτήσεις

01

Transformer— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 7.4 × 10¹⁸ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA P100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

02

Transformer— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

Transformer— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

04

Transformer— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 213M. This page suggests the transformer has 213M parameters. "Although there are others architectures that make use of attention layers, none achieves so good results so fast. Not only that, but the only model that can compite against Transformer is the Slicenet22, proposed just fifteen days before. It takes much longer to train, due to the huge amount of parameters it requires (348 million against the 213 millions of Transformer), and the BLEU scores it achieves are slightly worse on average. In short, up to date it offers no profit over Transformer." https://ricardokleinklein.github.io/2017/11/16/Attention-is-all-you-need.html. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

Transformer— ποιος το δημιούργησε;

Δημοσιεύθηκε από Google Research,Google Brain, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry,Industry.

06

Transformer— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε June 2017. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

07

Transformer— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του translation. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 1 January 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.