Memformer (4 encoder + 16 decoder)
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- UC Davis,Westlake University,Facebook AI
- Typ organizacji
- Academia,Academia,Industry
- Kraj
- United States of America, China
- Opublikowany
- 14 October 2020
- Autorzy
- Qingyang Wu, Zhenzhong Lan, Kun Qian, Jing Gu, Alborz Geramifard, Zhou Yu
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Language
- Zadanie
- Language modeling
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 76.2M
- Dane treningowe
- 103,000,000 tokens
- Epoki
- 11.93
batch size 128 steps: 150000 sequence length: 128-1024
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 1.2 × 10¹⁹ FLOP
- Jak to zostało ustalone
- Hardware
32400000000000 FLOP / second / GPU * 4 GPUs * 96 hours * 3600 sec / hour * 0.3 [assumed utilization] = 1.3436928e+19 FLOP time could be given for all language modeling not just for this model -> likely to be an upper bound
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- NVIDIA Tesla V100 DGXS 16 GB,NVIDIA GeForce RTX 2080 Ti 11GB
- Zastosowane chipy
- 4
- Czas rzeczywisty
- 96 hours
"We trained our model on NVIDIA V100 16GB and 2080Ti 11GB. <..> The training for language modeling took approximately four days on four GPUs." 4 days = 96 hours
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- Unreleased
- Kod treningowy
- Unreleased
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Zapisz pewność
- Likely
- Cytaty
- 77
- Dane benchmarkowe
- Memformer (4 encoder + 16 decoder)
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- Memformer: A Memory-Augmented Transformer for Sequence Modeling
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
O tym modelu
Memformer (4 encoder + 16 decoder) został opublikowany przez UC Davis,Westlake University,Facebook AI, w kraju zapisanym jako United States of America, podczas October 2020. Wychodzi z organizacji zaklasyfikowanej jako academia,Academia,Industry.
Działa w dziedzinie Language, i jest zapisany jako wykonujący zadanie language modeling.
Ponieważ wagi nie są dostępne, żadne z danych dotyczących sprzętu gdzie indziej na tej stronie się do niego nie odnoszą.
Jak to zostało wytrenowane
Trening zajmował około 1.2 × 10¹⁹ FLOP, na sprzęcie zarejestrowanym jako NVIDIA Tesla V100 DGXS 16 GB,NVIDIA GeForce RTX 2080 Ti 11GB. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Zbiór treningowy trwał około 103,000,000 Tokeny tekstu.
Odpowiedzi
Memformer (4 encoder + 16 decoder) — częste pytania
Memformer (4 encoder + 16 decoder)— kto to stworzył?
Zostało opublikowane przez UC Davis,Westlake University,Facebook AI, oparty na United States of America, organizacja sklasyfikowana jako academia,Academia,Industry.
Memformer (4 encoder + 16 decoder)— kiedy to zostało wydane?
Zostało opublikowane w October 2020. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
Memformer (4 encoder + 16 decoder)— do czego to służy?
Działa w dziedzinie Language, i jest zarejestrowany jako realizujący zadanie language modeling. Model może obsługiwać kilka z każdego, więc to są obszary, dla których został zbudowany, a nie ograniczenie tego, co będzie próbował.
Memformer (4 encoder + 16 decoder)— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 1.2 × 10¹⁹ FLOP, na sprzęcie zarejestrowanym jako NVIDIA Tesla V100 DGXS 16 GB,NVIDIA GeForce RTX 2080 Ti 11GB. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
Memformer (4 encoder + 16 decoder)— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
Memformer (4 encoder + 16 decoder)— czy jest open weight?
Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.
Memformer (4 encoder + 16 decoder)— ile ma parametrów?
Ma liczbę parametrów równą 76.2M. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.