GPT-4 (Jun 2023)
Brak szacunków
Brak wymagań sprzętowych dla tego modelu
Wagi tego modelu nie zostały opublikowane, dlatego nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny wyłącznie poprzez jego dostawcę, a żadna karta graficzna tego nie zmieni.
Na nagraniu
Pełna specyfikacja
Wszystko, co jest dostępne na temat tego modelu. Większość z tego opisuje, jak został wytrenowany, a nie jak działa — przydatny kontekst do oceny, ile pracy w to włożono i jak wypada na tle modeli zbudowanych na innym poziomie skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- OpenAI
- Typ organizacji
- Industry
- Kraj
- United States of America
- Opublikowane
- 13 June 2023
- Autorzy
- OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, Red Avila, Igor Babuschkin, Suchir Balaji, Valerie Balcom, Paul Baltescu, Haiming Bao, Mohammad Bavarian, Jeff Belgum, Irwan Bello, Jake Berdine, Gabriel Bernadett-Shapiro, Christopher Berner, Lenny Bogdonoff, Oleg Boiko, Madelaine Bo…
Co to robi
Obszary problemowe, dla których stworzono model. Model może zawierać kilka z każdej.
- Domena
- Multimodal, Language, Vision
- Zadanie
- Language modeling, Language modeling/generation, Question answering, Visual question answering
- Podejście
- Self-supervised learning
- Model bazowy
- GPT-4 (Mar 2023)
Rozmiar
Jakiej wielkości jest model i na ile danych był szkolony. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- Parametry
- 1.8T
- Dane treningowe
- 5,416,666,666,667 tokens
- Epoki
- 2
- Rozmiar wsadu
- 60,000,000
Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/
Speculative. Reported secondhand by online sources such as Semianalysis, but not verified by OpenAI. If total number of tokens seen was 13T, text was repeated for 2 epochs, and text was the majority of tokens, then dataset size roughly is 13T*0.75/2 = 4.9T words. Note this examines only the text dataset, since GPT-4 was first and foremost a language model. However, the vision component had its own vision dataset, which we believe accounted for a much smaller part of the compute budget.
MoE so i hesitate but 7.5 mill? https://www.reddit.com/r/mlscaling/comments/14wcy7m/gpt4s_details_are_leaked/#:~:text=There%20is%20millions%20of%20rows,get%20the%20real%20batch%20size.
Obliczenia szkoleniowe
Aritmetyka wykonywana w celu wytrenowania modelu, mierzone w operacjach zmiennoprzecinkowych. Jest to miara kosztu przeprowadzonego treningu, a nie tego, jak szybko gotowy model odpowiada na twoje zapytania.
- Obliczenia szkoleniowe
- 2.1 × 10²⁵ FLOP
- Jak to zostało ustalone
- Hardware
90% CI: 8.2E+24 to 4.4E+25 NOTE: this is a rough estimate based on public information, much less information than most other systems in the database. Calculation and confidence intervals here: https://colab.research.google.com/drive/1O99z9b1I5O66bT78r9ScslE_nOj5irN9?usp=sharing
Trening
Co fizycznie zajęło szkolenie: które chipy, ile ich, na jak długo i ile to pobrało z sieci.
- Sprzęt szkoleniowy
- NVIDIA A100 SXM4 40 GB
- Chips użyte
- 25,000
- Chip-godziny
- 57,000,000
- Czas zegarowy
- 2,280 hours (95 days)
- Wykorzystanie sprzętu
- MFU 34.0%
- Pobór mocy
- 19.9 MW
(Speculative) SemiAnalysis conjectures that GPT-4 training took 90-100 days with utilization of 32-36%.
CANNOT VERIFY, LIKELY HFU, PAYWALLED. (Speculative) SemiAnalysis conjectures that GPT-4 had utilization of 32-36%: https://www.semianalysis.com/p/gpt-4-architecture-infrastructure
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim własnym sprzęcie, co decyduje, czy jakiekolwiek z danych dotyczących karty graficznej na tej stronie mają zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- API access
- Kod treningowy
- Unreleased
Jak jest klasyfikowane
Etykiety stosowane przez źródłowy zbiór danych podczas śledzenia znaczących modeli oraz jak pewny jest w danym wpisie.
- Model graniczny
- Yes
- Model bazowy
- Yes
- Prawdopodobnie powyżej 10²³ FLOP
- Yes
- Dlaczego jest śledzone
- Highly cited,SOTA improvement,Training cost
- Zaufanie do nagrania
- Likely
- Cytacje
- 24,490
See the paper, p.1: "On a suite of traditional NLP benchmarks, GPT-4 outperforms both previous large language models and most state-of-the-art systems (which often have benchmark-specific training or hand-engineering)." "On the MMLU benchmark [35, 36], an English-language suite of multiple-choice questions covering 57 subjects, GPT-4 not only outperforms existing models by a considerable margin in English, but also demonstrates strong performance in other languages"
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- GPT-4 Technical Report
- Ostatnia aktualizacja
- 24 June 2026
Co oznaczają liczby
Czym jest ten model
GPT-4 (Cze 2023) został opublikowany przez OpenAI, w Stanach Zjednoczonych Ameryki, w czerwcu 2023. Wychodzi z przemysłu.
Działa w Multimodal, Język, Wizja, i jest rejestrowane jako wykonujące modelowanie języka, modelowanie/ generowanie języka, odpowiadanie na pytania, wizualne odpowiadanie na pytania.
Opiera się na GPT-4 (marzec 2023), dlatego dzieli ogólny kształt i rozmiar tego modelu.
Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żadna karta graficzna tego nie zmieni.
Jak to było trenowane
Treningowy bieg zużył około 2,1 × 10²⁵ FLOP na NVIDIA A100 SXM4 40 GB. Ta liczba opisuje koszt jego stworzenia i nie ma wpływu na to, jak szybko generuje tekst.
Około 5,416,666,666,667 tokenów zostało użytych do jego trenowania.
Jest śledzone w podstawowym zbiorze danych z jednego szczególnego powodu: wysoko cytowane, poprawa SOTA, koszt szkolenia.
Odpowiedzi
GPT-4 (Jun 2023) — Często zadawane pytania
Kiedy został wydany GPT-4 (czerwiec 2023)?
GPT-4 (Cze 2023) został opublikowany w czerwcu 2023. Możliwości na parametr znacznie się poprawiły od tego czasu, więc nowszy model o tym samym rozmiarze często lepiej wykorzystuje ten sam sprzęt.
Do czego służy GPT-4 (cze 2023)?
GPT-4 (Cze 2023) działa w Multimodal, Język, Wizja, i jest rejestrowany jako obsługujący modelowanie języka, modelowanie/generowanie języka, Odpowiadanie na pytania, Wizualne odpowiadanie na pytania. Model może obsługiwać kilka z każdego z nich, więc to są obszary, dla których został zbudowany, a nie ograniczenie tego, co spróbuje.
Ile obliczeń było użytych do treningu GPT-4 (czerwiec 2023)?
Około 2,1 × 10²⁵ FLOP, na NVIDIA A100 SXM4 40 GB. To mierzy, ile kosztowało wyprodukowanie modelu i nic nie mówi o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z przepustowości pamięci, a nie z budżetu treningowego.
Jaką GPU potrzebuję, aby uruchomić GPT-4 (cze 2023)?
Żaden. GPT-4 (czerwiec 2023) to zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie w żadnej cenie. Jest dostępny tylko przez swojego dostawcę.
Czy GPT-4 (cze 2023) jest otwartym źródłem?
Nie. GPT-4 (czerwiec 2023) nie ma opublikowanych wag, więc istnieje tylko jako usługa kontrolowana przez swojego właściciela.
Ile parametrów ma GPT-4 (czerwiec 2023)?
GPT-4 (Cze 2023) ma 1.8T parametrów. Plotki mówią o 1.8T parametrach MoE z 280B aktywowanymi podczas przejścia do przodu, według https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Inne źródła szacują 1.76T z 220B na przejście do przodu https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/. Ta liczba to całkowita ilość, która decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, której używa większość ludzi.
Kto stworzył GPT-4 (czerwiec 2023)?
GPT-4 (Cze 2023) został opublikowany przez OpenAI, z siedzibą w Stanach Zjednoczonych Ameryki, sklasyfikowany jako przemysł.
W innym kierunku
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, wszystko co będzie ona obsługiwać, Rozpocznij od sprzętu..