GPT-4 (Mar 2023)
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- OpenAI
- Typ organizacji
- Industry
- Kraj
- United States of America
- Opublikowany
- 15 March 2023
- Autorzy
- OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, Red Avila, Igor Babuschkin, Suchir Balaji, Valerie Balcom, Paul Baltescu, Haiming Bao, Mohammad Bavarian, Jeff Belgum, Irwan Bello, Jake Berdine, Gabriel Bernadett-Shapiro, Christopher Berner, Lenny Bogdonoff, Oleg Boiko, Madelaine Bo…
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Multimodal, Language, Vision
- Zadanie
- Language modeling, Language modeling/generation, Question answering, Visual question answering
- Podejście
- Self-supervised learning
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 1.8T
- Dane treningowe
- 5,416,666,666,667 tokens
- Epoki
- 2
- Rozmiar wsadu
- 60,000,000
Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/
Speculative. Reported secondhand by online sources such as Semianalysis, but not verified by OpenAI. If total number of tokens seen was 13T, text was repeated for 2 epochs, and text was the majority of tokens, then dataset size roughly is 13T*0.75/2 = 4.9T words. Note this examines only the text dataset, since GPT-4 was first and foremost a language model. However, the vision component had its own vision dataset, which we believe accounted for a much smaller part of the compute budget.
not listed
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 2.1 × 10²⁵ FLOP
- Jak to zostało ustalone
- Hardware
90% CI: 8.2E+24 to 4.4E+25 NOTE: this is a rough estimate based on public information, much less information than most other systems in the database. Calculation and confidence intervals here: https://colab.research.google.com/drive/1O99z9b1I5O66bT78r9ScslE_nOj5irN9?usp=sharing
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- NVIDIA A100 SXM4 40 GB
- Zastosowane chipy
- 25,000
- Czas-chip
- 57,000,000
- Czas rzeczywisty
- 2,280 hours (95 days)
- Wykorzystanie sprzętu
- MFU 34.0%
- Pobór mocy
- 19.9 MW
- Koszt obliczeniowy
- $37,334,305
(Speculative) SemiAnalysis conjectures that GPT-4 training took 90-100 days with utilization of 32-36%.
CANNOT VERIFY, LIKELY HFU, PAYWALLED. (Speculative) SemiAnalysis conjectures that GPT-4 had utilization of 32-36%: https://www.semianalysis.com/p/gpt-4-architecture-infrastructure
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- API access
- Kod treningowy
- Unreleased
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Model Frontier
- Yes
- Model bazowy
- Yes
- Prawdopodobnie powyżej 10²³ FLOP
- Yes
- Dlaczego to jest śledzone
- Highly cited,SOTA improvement,Training cost
- Zapisz pewność
- Likely
- Cytaty
- 24,490
See the paper, p.1: "On a suite of traditional NLP benchmarks, GPT-4 outperforms both previous large language models and most state-of-the-art systems (which often have benchmark-specific training or hand-engineering)." "On the MMLU benchmark [35, 36], an English-language suite of multiple-choice questions covering 57 subjects, GPT-4 not only outperforms existing models by a considerable margin in English, but also demonstrates strong performance in other languages"
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- GPT-4 Technical Report
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
Skąd to pochodzi
GPT-4 (Mar 2023) został opublikowany przez OpenAI, w kraju zapisanym jako United States of America, podczas March 2023. Organizacja publikująca jest klasyfikowana jako industry.
Działa w dziedzinie Multimodal, Language, Vision, i jest zapisany jako wykonujący zadanie language modeling, Language modeling/generation, Question answering, Visual question answering.
Ponieważ wagi nie są dostępne, żadne z danych dotyczących sprzętu gdzie indziej na tej stronie się do niego nie odnoszą.
Co poszło w budowę tego
Trenowanie zajęło budżet obliczeniowy wynoszący około 2.1 × 10²⁵ FLOP, na sprzęcie zarejestrowanym jako NVIDIA A100 SXM4 40 GB. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Trening zużył korpus około 5,416,666,666,667 Tokeny tekstu.
Kryterium włączenia: highly cited,SOTA improvement,Training cost.
Odpowiedzi
GPT-4 (Mar 2023) — częste pytania
GPT-4 (Mar 2023)— do czego to służy?
Działa w dziedzinie Multimodal, Language, Vision, i jest zarejestrowany jako realizujący zadanie language modeling, Language modeling/generation, Question answering, Visual question answering. Modele często mają więcej niż jeden z każdego, a etykiety opisują cel, a nie ograniczenia możliwości.
GPT-4 (Mar 2023)— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 2.1 × 10²⁵ FLOP, na sprzęcie zarejestrowanym jako NVIDIA A100 SXM4 40 GB. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
GPT-4 (Mar 2023)— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
GPT-4 (Mar 2023)— czy jest open weight?
Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.
GPT-4 (Mar 2023)— ile ma parametrów?
Ma liczbę parametrów równą 1.8T. Rumored to be 1.8T parameter MoE with 280B activated on the forward pass, per https://www.semianalysis.com/p/gpt-4-architecture-infrastructure. Other sources estimate 1.76T with 220B per forward pass https://web.archive.org/web/20230712123915/https://the-decoder.com/gpt-4-architecture-datasets-costs-and-more-leaked/. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
GPT-4 (Mar 2023)— kto to stworzył?
Zostało opublikowane przez OpenAI, oparty na United States of America, organizacja sklasyfikowana jako industry.
GPT-4 (Mar 2023)— kiedy to zostało wydane?
Zostało opublikowane w March 2023. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.