GPT-4 (Mar 2023)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- OpenAI
- Τύπος οργανισμού
- Industry
- Χώρα
- United States of America
- Δημοσιευμένο
- 15 March 2023
- Συγγραφείς
- OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, Red Avila, Igor Babuschkin, Suchir Balaji, Valerie Balcom, Paul Baltescu, Haiming Bao, Mohammad Bavarian, Jeff Belgum, Irwan Bello, Jake Berdine, Gabriel Bernadett-Shapiro, Christopher Berner, Lenny Bogdonoff, Oleg Boiko, Madelaine Bo…
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Multimodal, Language, Vision
- Εργασία
- Language modeling, Language modeling/generation, Question answering, Visual question answering
- Προσέγγιση
- Self-supervised learning
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 1.8T
- Δεδομένα εκπαίδευσης
- 5,416,666,666,667 tokens
- Εποχές
- 2
- Μέγεθος παρτίδας
- 60,000,000
Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/
Speculative. Reported secondhand by online sources such as Semianalysis, but not verified by OpenAI. If total number of tokens seen was 13T, text was repeated for 2 epochs, and text was the majority of tokens, then dataset size roughly is 13T*0.75/2 = 4.9T words. Note this examines only the text dataset, since GPT-4 was first and foremost a language model. However, the vision component had its own vision dataset, which we believe accounted for a much smaller part of the compute budget.
not listed
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 2.1 × 10²⁵ FLOP
- Πώς ιδρύθηκε
- Hardware
90% CI: 8.2E+24 to 4.4E+25 NOTE: this is a rough estimate based on public information, much less information than most other systems in the database. Calculation and confidence intervals here: https://colab.research.google.com/drive/1O99z9b1I5O66bT78r9ScslE_nOj5irN9?usp=sharing
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA A100 SXM4 40 GB
- χρησιμοποιούμενα τσιπ
- 25,000
- Τσιπ-ώρες
- 57,000,000
- Χρόνος τοίχου
- 2,280 hours (95 days)
- Χρήση υλικού
- MFU 34.0%
- Κατανάλωση ενέργειας
- 19.9 MW
- Κόστος υπολογισμού
- $37,334,305
(Speculative) SemiAnalysis conjectures that GPT-4 training took 90-100 days with utilization of 32-36%.
CANNOT VERIFY, LIKELY HFU, PAYWALLED. (Speculative) SemiAnalysis conjectures that GPT-4 had utilization of 32-36%: https://www.semianalysis.com/p/gpt-4-architecture-infrastructure
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- API access
- Κωδικός εκπαίδευσης
- Unreleased
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Μοντέλο Frontier
- Yes
- Μοντέλο Θεμελίωσης
- Yes
- Πιθανώς πάνω από 10²³ FLOP
- Yes
- Γιατί παρακολουθείται
- Highly cited,SOTA improvement,Training cost
- Εγγραφή εμπιστοσύνης
- Likely
- Παραπομπές
- 24,490
See the paper, p.1: "On a suite of traditional NLP benchmarks, GPT-4 outperforms both previous large language models and most state-of-the-art systems (which often have benchmark-specific training or hand-engineering)." "On the MMLU benchmark [35, 36], an English-language suite of multiple-choice questions covering 57 subjects, GPT-4 not only outperforms existing models by a considerable margin in English, but also demonstrates strong performance in other languages"
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- GPT-4 Technical Report
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Από πού προήλθε
GPT-4 (Mar 2023) δημοσιεύθηκε από OpenAI, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια March 2023. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.
Λειτουργεί στον τομέα της Multimodal, Language, Vision, και καταγράφεται ότι εκτελεί την εργασία του language modeling, Language modeling/generation, Question answering, Visual question answering.
Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.
Τι χρειάστηκε για την κατασκευή του
Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 2.1 × 10²⁵ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A100 SXM4 40 GB. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 5,416,666,666,667 κωδικοί κειμένου
Το κριτήριο συμπερασμού του: highly cited,SOTA improvement,Training cost.
Απαντήσεις
GPT-4 (Mar 2023) — κοινές ερωτήσεις
GPT-4 (Mar 2023)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Multimodal, Language, Vision, και καταγράφεται ως διαχείριση της εργασίας του language modeling, Language modeling/generation, Question answering, Visual question answering. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
GPT-4 (Mar 2023)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 2.1 × 10²⁵ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A100 SXM4 40 GB. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
GPT-4 (Mar 2023)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
GPT-4 (Mar 2023)— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
GPT-4 (Mar 2023)— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 1.8T. Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
GPT-4 (Mar 2023)— ποιος το δημιούργησε;
Δημοσιεύθηκε από OpenAI, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.
GPT-4 (Mar 2023)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε March 2023. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.