T2R 75% + Pretrain (WT-103)

Zamknięte wagi University of Washington,Microsoft,DeepMind 668.9M parametry March 2021

Brak oszacowania

Brak wymagań sprzętowych dla tego modelu

Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..

Na nagranie

Pełna specyfikacja

Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..

Pochodzenie

Kto zbudował ten model, gdzie i kiedy został opublikowany.

Organizacja
University of Washington,Microsoft,DeepMind
Typ organizacji
Academia,Industry,Industry
Kraj
United States of America, United Kingdom of Great Britain and Northern Ireland
Opublikowany
24 March 2021
Autorzy
Jungo Kasai, Hao Peng, Yizhe Zhang, Dani Yogatama, Gabriel Ilharco, Nikolaos Pappas, Yi Mao, Weizhu Chen, Noah A. Smith

Co to robi

Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.

Domena
Language
Zadanie
Language modeling

Rozmiar

Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.

parametry
668.9M

Vocabulary size unclear, ~260k if they directly use WT 103 Assumed tied embeddings Remaining parameters: 32 layers 8 attention heads (H) 128 head dimensions (N, D) 1024 model (embedding) dimensions (W, M) 4096 feedforward dimensions "We partition the training data into non-overlapping blocks of 512 contiguous tokens" MLP layer: 2*1024*4096=8388608 Att layer: H×(W×(2×D + N) + N×M) 8*(1024*(2*128+128)+128*1024)=4194304 Total non embedding: 32*(8388608+4194304)=402653184 Embedding: 260000*1024…

Dane treningowe
tokens
Epoki
34.47

Obliczenia treningowe

Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.

Obliczenia treningowe
1.4 × 10¹⁹ FLOP

Table 4, "We found that we could speed up training by reducing the warm-up steps, total update steps, maximum and minimum rates, and batch size to 8K steps, 142K steps, 5 ⋅ 10−6, 0.5, and 25K tokens " 142K updates, 25k token batches Training compute: 6*668893184*142000*25000=1.4247425e+19 GPU hour estimate: 95*60*60*125000000000000*0.3=1.2825e+19 Geometric mean: 13517515512289972224 Epochs: 142000*25000/103000000=34.4660194175

Jak to zostało ustalone
Operation counting,Hardware

Przebieg szkolenia

Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.

Sprzęt do trenowania
NVIDIA V100
Zastosowane chipy
8
Czas rzeczywisty
12 hours

95h GPU time / 8 GPUs ~11.8h wall clock time

Pobór mocy
4.9 kW

Dostępność

Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.

Wagi
Closed — provider access only
Dostęp do modelu
Unreleased
Kod treningowy
Unreleased

There's a repo but it's kind of inscrutable with no docs about T2R, not clear if the training code for this paper is in it: https://github.com/jungokasai/T2R/tree/master

Jak jest klasyfikowane

Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.

Zapisz pewność
Confident
Cytaty
94
Dane benchmarkowe
T2R 75% + Pretrain

Źródła

Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.

Referencja
Finetuning Pretrained Transformers into RNNs
Ostatnio zaktualizowane
25 May 2026

Co oznaczają liczby

O tym modelu

T2R 75% + Pretrain (WT-103) został opublikowany przez University of Washington,Microsoft,DeepMind, w kraju zapisanym jako United States of America, podczas March 2021. Organizacja publikująca jest klasyfikowana jako academia,Industry,Industry.

Działa w dziedzinie Language, i jest zapisany jako wykonujący zadanie language modeling.

Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żaden procesor graficzny tego nie zmieni.

Co poszło w budowę tego

Trening zajmował około 1.4 × 10¹⁹ FLOP, na sprzęcie zarejestrowanym jako NVIDIA V100. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.

Odpowiedzi

T2R 75% + Pretrain (WT-103) — częste pytania

01

T2R 75% + Pretrain (WT-103)— kiedy to zostało wydane?

Zostało opublikowane w March 2021. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.

02

T2R 75% + Pretrain (WT-103)— do czego to służy?

Działa w dziedzinie Language, i jest zarejestrowany jako realizujący zadanie language modeling. Model może obsługiwać kilka z każdego, więc to są obszary, dla których został zbudowany, a nie ograniczenie tego, co będzie próbował.

03

T2R 75% + Pretrain (WT-103)— ile mocy obliczeniowej użyto do jego trenowania?

Szkolenie zajęło około 1.4 × 10¹⁹ FLOP, na sprzęcie zarejestrowanym jako NVIDIA V100. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.

04

T2R 75% + Pretrain (WT-103)— Jaką GPU potrzebuję, aby ją uruchomić?

Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.

05

T2R 75% + Pretrain (WT-103)— czy jest open weight?

Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.

06

T2R 75% + Pretrain (WT-103)— ile ma parametrów?

Ma liczbę parametrów równą 668.9M. Vocabulary size unclear, ~260k if they directly use WT 103 Assumed tied embeddings Remaining parameters: 32 layers 8 attention heads (H) 128 head dimensions (N, D) 1024 model (embedding) dimensions (W, M) 4096 feedforward dimensions "We partition the training data into non-overlapping blocks of 512 contiguous tokens" MLP layer: 2*1024*4096=8388608 Att layer: H×(W×(2×D + N) + N×M) 8*(1024*(2*128+128)+128*1024)=4194304 Total non embedding: 32*(8388608+4194304)=402653184 Embedding: 260000*1024=266240000 Total: 402653184+266240000=668893184. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.

07

T2R 75% + Pretrain (WT-103)— kto to stworzył?

Zostało opublikowane przez University of Washington,Microsoft,DeepMind, oparty na United States of America, organizacja sklasyfikowana jako academia,Industry,Industry.

Źródło

Oryginalna publikacja

Ostatnia aktualizacja rekordu 25 May 2026

Druga strona

Patrząc na to z drugiej strony?

Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.