ViT-G/14
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Google Brain,Google Research
- Τύπος οργανισμού
- Industry,Industry
- Χώρα
- United States of America
- Δημοσιευμένο
- 8 June 2021
- Συγγραφείς
- X Zhai, A Kolesnikov, N Houlsby, L Beyer
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Vision
- Εργασία
- Image classification
- Προσέγγιση
- Self-supervised learning
- Αριθμητική μορφή
- BF16
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 1.8B
- Δεδομένα εκπαίδευσης
- 3,000,000,000 tokens
- Εποχές
- 54.6
- Μέγεθος παρτίδας
- 32,768
Table 2 of paper
"For this study, we use the proprietary JFT-3B dataset, a larger version of the JFT-300M dataset used in many previous works on large-scale computer vision models [31, 18, 11]. This dataset consists of nearly 3 billion images, annotated with a class-hierarchy of around 30k labels via a semi-automatic pipeline" Epochs: 5M steps (Table 11) * 32768 (batch size) / 3B = 54.6 epochs
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 5.9 × 10²² FLOP
- Πώς ιδρύθηκε
- Hardware,Operation counting
Digitizing Figure 9 indicates training used 27,200 TPUv3 core-days. TPUv3 is 123 teraflop/s per chip, 2 cores per chip. 1.23e14 * (1/2) * 27,200 * 24 * 3600 * 0.4 = 5.78e22 Alternatively, Table 2 indicates 965.3e9 FLOPs per forward pass on a 224^2 image. Table 4 indicates 5 million steps at a (normalized) batch size of 4096, and total flops including backward pass would be 3x the FLOPs from forward passes alone, so we get: 4096 * 5e6 * 965.3e9 * 3 = 5.93e22 (Note that actual batch size appear…
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- Google TPU v3
- χρησιμοποιούμενα τσιπ
- 2,048
- Κατανάλωση ενέργειας
- 1.9 MW
- Κόστος υπολογισμού
- $3,848
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Open source
About the weights: https://twitter.com/giffmana/status/1402507421029916672 About the code: Apache 2.0 https://github.com/google-research/big_vision/blob/main/big_vision/configs/proj/scaling_laws/train_vit_g.py
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Γιατί παρακολουθείται
- SOTA improvement
- Εγγραφή εμπιστοσύνης
- Confident
- Παραπομπές
- 1,393
"we successfully train a ViT model with two billion parameters, which attains a new state-of-the-art on ImageNet of 90.45% top-1 accuracy"
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Scaling Vision Transformers
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Τι είναι αυτό το μοντέλο
ViT-G/14 δημοσιεύθηκε από Google Brain,Google Research, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια June 2021. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry,Industry.
Λειτουργεί στον τομέα της Vision, και καταγράφεται ότι εκτελεί την εργασία του image classification.
Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.
Τι χρειάστηκε για την κατασκευή του
Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 5.9 × 10²² FLOP, σε υλικό καταγεγραμμένο ως Google TPU v3. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Εκπαιδεύτηκε σε ένα σώμα περίπου 3,000,000,000 κωδικοί κειμένου
Ο λόγος που εμφανίζεται σε αυτόν τον κατάλογο είναι: sOTA improvement.
Απαντήσεις
ViT-G/14 — κοινές ερωτήσεις
ViT-G/14— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε June 2021. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
ViT-G/14— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Vision, και καταγράφεται ως διαχείριση της εργασίας του image classification. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.
ViT-G/14— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 5.9 × 10²² FLOP, σε υλικό καταγεγραμμένο ως Google TPU v3. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
ViT-G/14— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
ViT-G/14— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
ViT-G/14— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 1.8B. Table 2 of paper. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
ViT-G/14— ποιος το δημιούργησε;
Δημοσιεύθηκε από Google Brain,Google Research, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry,Industry.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.