GPT-4 (Jun 2023)

Zamknięte wagi OpenAI 1.8T Parametry June 2023

Brak szacunków

Brak wymagań sprzętowych dla tego modelu

Wagi tego modelu nie zostały opublikowane, dlatego nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny wyłącznie poprzez jego dostawcę, a żadna karta graficzna tego nie zmieni.

Na nagraniu

Pełna specyfikacja

Wszystko, co jest dostępne na temat tego modelu. Większość z tego opisuje, jak został wytrenowany, a nie jak działa — przydatny kontekst do oceny, ile pracy w to włożono i jak wypada na tle modeli zbudowanych na innym poziomie skali..

Pochodzenie

Kto zbudował ten model, gdzie i kiedy został opublikowany.

Organizacja
OpenAI
Typ organizacji
Industry
Kraj
United States of America
Opublikowane
13 June 2023
Autorzy
OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, Red Avila, Igor Babuschkin, Suchir Balaji, Valerie Balcom, Paul Baltescu, Haiming Bao, Mohammad Bavarian, Jeff Belgum, Irwan Bello, Jake Berdine, Gabriel Bernadett-Shapiro, Christopher Berner, Lenny Bogdonoff, Oleg Boiko, Madelaine Bo…

Co to robi

Obszary problemowe, dla których stworzono model. Model może zawierać kilka z każdej.

Domena
Multimodal, Language, Vision
Zadanie
Language modeling, Language modeling/generation, Question answering, Visual question answering
Podejście
Self-supervised learning
Model bazowy
GPT-4 (Mar 2023)

Rozmiar

Jakiej wielkości jest model i na ile danych był szkolony. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.

Parametry
1.8T

Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/

Dane treningowe
5,416,666,666,667 tokens

Speculative. Reported secondhand by online sources such as Semianalysis, but not verified by OpenAI. If total number of tokens seen was 13T, text was repeated for 2 epochs, and text was the majority of tokens, then dataset size roughly is 13T*0.75/2 = 4.9T words. Note this examines only the text dataset, since GPT-4 was first and foremost a language model. However, the vision component had its own vision dataset, which we believe accounted for a much smaller part of the compute budget.

Epoki
2
Rozmiar wsadu
60,000,000

MoE so i hesitate but 7.5 mill? https://www.reddit.com/r/mlscaling/comments/14wcy7m/gpt4s_details_are_leaked/#:~:text=There%20is%20millions%20of%20rows,get%20the%20real%20batch%20size.

Obliczenia szkoleniowe

Aritmetyka wykonywana w celu wytrenowania modelu, mierzone w operacjach zmiennoprzecinkowych. Jest to miara kosztu przeprowadzonego treningu, a nie tego, jak szybko gotowy model odpowiada na twoje zapytania.

Obliczenia szkoleniowe
2.1 × 10²⁵ FLOP

90% CI: 8.2E+24 to 4.4E+25 NOTE: this is a rough estimate based on public information, much less information than most other systems in the database. Calculation and confidence intervals here: https://colab.research.google.com/drive/1O99z9b1I5O66bT78r9ScslE_nOj5irN9?usp=sharing

Jak to zostało ustalone
Hardware

Trening

Co fizycznie zajęło szkolenie: które chipy, ile ich, na jak długo i ile to pobrało z sieci.

Sprzęt szkoleniowy
NVIDIA A100 SXM4 40 GB
Chips użyte
25,000
Chip-godziny
57,000,000
Czas zegarowy
2,280 hours (95 days)

(Speculative) SemiAnalysis conjectures that GPT-4 training took 90-100 days with utilization of 32-36%.

Wykorzystanie sprzętu
MFU 34.0%

CANNOT VERIFY, LIKELY HFU, PAYWALLED. (Speculative) SemiAnalysis conjectures that GPT-4 had utilization of 32-36%: https://www.semianalysis.com/p/gpt-4-architecture-infrastructure

Pobór mocy
19.9 MW

Dostępność

Czy możesz zdobyć model i uruchomić go na swoim własnym sprzęcie, co decyduje, czy jakiekolwiek z danych dotyczących karty graficznej na tej stronie mają zastosowanie.

Wagi
Closed — provider access only
Dostęp do modelu
API access
Kod treningowy
Unreleased

Jak jest klasyfikowane

Etykiety stosowane przez źródłowy zbiór danych podczas śledzenia znaczących modeli oraz jak pewny jest w danym wpisie.

Model graniczny
Yes
Model bazowy
Yes
Prawdopodobnie powyżej 10²³ FLOP
Yes
Dlaczego jest śledzone
Highly cited,SOTA improvement,Training cost

See the paper, p.1: "On a suite of traditional NLP benchmarks, GPT-4 outperforms both previous large language models and most state-of-the-art systems (which often have benchmark-specific training or hand-engineering)." "On the MMLU benchmark [35, 36], an English-language suite of multiple-choice questions covering 57 subjects, GPT-4 not only outperforms existing models by a considerable margin in English, but also demonstrates strong performance in other languages"

Zaufanie do nagrania
Likely
Cytacje
24,490

Źródła

Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.

Referencja
GPT-4 Technical Report
Ostatnia aktualizacja
24 June 2026

Co oznaczają liczby

Czym jest ten model

GPT-4 (Cze 2023) został opublikowany przez OpenAI, w Stanach Zjednoczonych Ameryki, w czerwcu 2023. Wychodzi z przemysłu.

Działa w Multimodal, Język, Wizja, i jest rejestrowane jako wykonujące modelowanie języka, modelowanie/ generowanie języka, odpowiadanie na pytania, wizualne odpowiadanie na pytania.

Opiera się na GPT-4 (marzec 2023), dlatego dzieli ogólny kształt i rozmiar tego modelu.

Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żadna karta graficzna tego nie zmieni.

Jak to było trenowane

Treningowy bieg zużył około 2,1 × 10²⁵ FLOP na NVIDIA A100 SXM4 40 GB. Ta liczba opisuje koszt jego stworzenia i nie ma wpływu na to, jak szybko generuje tekst.

Około 5,416,666,666,667 tokenów zostało użytych do jego trenowania.

Jest śledzone w podstawowym zbiorze danych z jednego szczególnego powodu: wysoko cytowane, poprawa SOTA, koszt szkolenia.

Odpowiedzi

GPT-4 (Jun 2023) — Często zadawane pytania

01

Kiedy został wydany GPT-4 (czerwiec 2023)?

GPT-4 (Cze 2023) został opublikowany w czerwcu 2023. Możliwości na parametr znacznie się poprawiły od tego czasu, więc nowszy model o tym samym rozmiarze często lepiej wykorzystuje ten sam sprzęt.

02

Do czego służy GPT-4 (cze 2023)?

GPT-4 (Cze 2023) działa w Multimodal, Język, Wizja, i jest rejestrowany jako obsługujący modelowanie języka, modelowanie/generowanie języka, Odpowiadanie na pytania, Wizualne odpowiadanie na pytania. Model może obsługiwać kilka z każdego z nich, więc to są obszary, dla których został zbudowany, a nie ograniczenie tego, co spróbuje.

03

Ile obliczeń było użytych do treningu GPT-4 (czerwiec 2023)?

Około 2,1 × 10²⁵ FLOP, na NVIDIA A100 SXM4 40 GB. To mierzy, ile kosztowało wyprodukowanie modelu i nic nie mówi o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z przepustowości pamięci, a nie z budżetu treningowego.

04

Jaką GPU potrzebuję, aby uruchomić GPT-4 (cze 2023)?

Żaden. GPT-4 (czerwiec 2023) to zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie w żadnej cenie. Jest dostępny tylko przez swojego dostawcę.

05

Czy GPT-4 (cze 2023) jest otwartym źródłem?

Nie. GPT-4 (czerwiec 2023) nie ma opublikowanych wag, więc istnieje tylko jako usługa kontrolowana przez swojego właściciela.

06

Ile parametrów ma GPT-4 (czerwiec 2023)?

GPT-4 (Cze 2023) ma 1.8T parametrów. Plotki mówią o 1.8T parametrach MoE z 280B aktywowanymi podczas przejścia do przodu, według https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Inne źródła szacują 1.76T z 220B na przejście do przodu https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/. Ta liczba to całkowita ilość, która decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, której używa większość ludzi.

07

Kto stworzył GPT-4 (czerwiec 2023)?

GPT-4 (Cze 2023) został opublikowany przez OpenAI, z siedzibą w Stanach Zjednoczonych Ameryki, sklasyfikowany jako przemysł.

Źródło

Publikacja oryginalna

Ostatnia aktualizacja rekordu 24 June 2026

W innym kierunku

Patrząc na to z drugiej strony?

Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, wszystko co będzie ona obsługiwać, Rozpocznij od sprzętu..