ST-MoE
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- Google,Google Brain,Google Research
- Typ organizacji
- Industry,Industry,Industry
- Kraj
- United States of America
- Opublikowany
- 17 February 2022
- Autorzy
- Barret Zoph, Irwan Bello, Sameer Kumar, Nan Du, Yanping Huang, Jeff Dean, Noam Shazeer, William Fedus
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Language
- Zadanie
- Language modeling/generation
- Format numeryczny
- BF16
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 269B
- Dane treningowe
- 1,500,000,000,000 tokens
- Rozmiar wsadu
- 1,000,000
269B. it's called ST-MoE-32B because it's equivalent to a 32B dense model.
"We pre-train for 1.5T tokens on a mixture of English-only C4 dataset (Raffel et al., 2019) and the dataset from GLaM (Du et al., 2021) summarized in Appendix E"
" We use 1M tokens per batch"
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 2.9 × 10²³ FLOP
- Jak to zostało ustalone
- Operation counting
The paper claims "scaling a sparse model to 269B parameters, with a computational cost comparable to a 32B dense encoder-decoder". If this is true for training cost, then 6*32e9*1.5e12 = 2.9e23
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- Unreleased
- Kod treningowy
- Open source
Apache License 2.0 Code for our models is available at https://github.com/tensorflow/mesh/blob/master/mesh_tensorflow/transformer/moe.py
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Prawdopodobnie powyżej 10²³ FLOP
- Yes
- Dlaczego to jest śledzone
- SOTA improvement
- Zapisz pewność
- Likely
- Cytaty
- 375
"ST-MoE-32B improves the current state-of-the-art on the test server submissions for both ARC Easy (92.7 → 94.8) and ARC Challenge (81.4 → 86.5)."
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- ST-MoE: Designing Stable and Transferable Sparse Expert Models
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
Tło
ST-MoE został opublikowany przez Google,Google Brain,Google Research, w kraju zapisanym jako United States of America, podczas February 2022. Kategoria, do której należy wydawca, to industry,Industry,Industry.
Działa w dziedzinie Language, i jest zapisany jako wykonujący zadanie language modeling/generation.
Ponieważ wagi nie są dostępne, żadne z danych dotyczących sprzętu gdzie indziej na tej stronie się do niego nie odnoszą.
Jak to zostało wytrenowane
Wytworzenie tego wymagało arytmetyki sumującej około 2.9 × 10²³ FLOP. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Zbiór treningowy trwał około 1,500,000,000,000 Tokeny tekstu.
Kryterium włączenia: sOTA improvement.
Odpowiedzi
ST-MoE — częste pytania
ST-MoE— kiedy to zostało wydane?
Zostało opublikowane w February 2022. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
ST-MoE— do czego to służy?
Działa w dziedzinie Language, i jest zarejestrowany jako realizujący zadanie language modeling/generation. Modele często mają więcej niż jeden z każdego, a etykiety opisują cel, a nie ograniczenia możliwości.
ST-MoE— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 2.9 × 10²³ FLOP. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
ST-MoE— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
ST-MoE— czy jest open weight?
Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.
ST-MoE— ile ma parametrów?
Ma liczbę parametrów równą 269B. 269B. it's called ST-MoE-32B because it's equivalent to a 32B dense model. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
ST-MoE— kto to stworzył?
Zostało opublikowane przez Google,Google Brain,Google Research, oparty na United States of America, organizacja sklasyfikowana jako industry,Industry,Industry.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.