ViT-22B
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- Typ organizacji
- Industry
- Kraj
- United States of America
- Opublikowany
- 10 February 2023
- Autorzy
- Mostafa Dehghani, Josip Djolonga, Basil Mustafa, Piotr Padlewski, Jonathan Heek, Justin Gilmer, Andreas Steiner, Mathilde Caron, Robert Geirhos, Ibrahim Alabdulmohsin, Rodolphe Jenatton, Lucas Beyer, Michael Tschannen, Anurag Arnab, Xiao Wang, Carlos Riquelme, Matthias Minderer, Joan Puigcerver, Utku Evci, Manoj Kumar, Sjoerd van Steenkiste, Gamaleldin F. Elsayed, Aravindh Mahendran, Fisher Yu, Av…
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Vision
- Zadanie
- Object detection, Image classification
- Format numeryczny
- BF16
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 21.7B
- Dane treningowe
- 4,000,000,000 tokens
- Epoki
- 2.9
21.743B, Table 1
"Dataset. ViT-22B is trained on a version of JFT (Sun et al., 2017), extended to around 4B images (Zhai et al., 2022a). These images have been semi-automatically annotated with a class-hierarchy of 30k labels"
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 1.9 × 10²³ FLOP
- Jak to zostało ustalone
- Hardware
"ViT-22B was trained using 256 visual tokens per image, where each token represents a 14 × 14 patch extracted from 224 × 224 sized images. ViT-22B is trained for 177k steps with batch size of 65k: approximately 3 epochs" "ViT-22B was trained on 1024 TPU V4 chips for 177K steps" "Using these techniques, ViT-22B processes 1.15k tokens per second per core during training (forward and backward pass) on TPUv4 [...] ViT-22B’s model flops utilization (MFU) is 54.9%" 256 * 177k * 65k = 2.945T tokens …
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- Google TPU v4
- Zastosowane chipy
- 1,024
- Czas rzeczywisty
- 347 hours (14.5 days)
- Wykorzystanie sprzętu
- MFU 54.9%
- Pobór mocy
- 694.9 kW
- Koszt obliczeniowy
- $285,556
"Using these techniques, ViT-22B processes 1.15k tokens per second per core during training (forward and backward pass)" From model card we know they trained with 1024 TPUv4 chips, and there are 2 cores per chip. Total number of tokens was 177K steps * 65k images/step * 256 tokens/image = 2.945T tokens So training time is 2.945T tokens / (1.15k * 2 * 1024) tokens/s = 1.25M seconds = 347.4 hours
"Using these techniques, ViT-22B processes 1.15k tokens per second per core during training (forward and backward pass) on TPUv4 [...] ViT-22B’s model flops utilization (MFU) is 54.9%"
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- Unreleased
- Kod treningowy
- Unreleased
don't see it here: https://github.com/google-research/vision_transformer?tab=readme-ov-file#available-vit-models
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Prawdopodobnie powyżej 10²³ FLOP
- Yes
- Dlaczego to jest śledzone
- SOTA improvement
- Zapisz pewność
- Confident
- Cytaty
- 862
"The largest ViT-22B sets the new SOTA on the challenging ObjectNet test set"
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- Scaling Vision Transformers to 22 Billion Parameters
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
Skąd to pochodzi
ViT-22B został opublikowany przez Google, w kraju zapisanym jako United States of America, podczas February 2023. Kategoria, do której należy wydawca, to industry.
Działa w dziedzinie Vision, i jest zapisany jako wykonujący zadanie object detection, Image classification.
Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żaden procesor graficzny tego nie zmieni.
Co poszło w budowę tego
Trening zajmował około 1.9 × 10²³ FLOP, na sprzęcie zarejestrowanym jako Google TPU v4. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Został wytrenowany na korpusie około 4,000,000,000 Tokeny tekstu.
Jest śledzone w podstawowym zbiorze danych z jednego szczególnego powodu: sOTA improvement.
Odpowiedzi
ViT-22B — częste pytania
ViT-22B— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 1.9 × 10²³ FLOP, na sprzęcie zarejestrowanym jako Google TPU v4. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
ViT-22B— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
ViT-22B— czy jest open weight?
Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.
ViT-22B— ile ma parametrów?
Ma liczbę parametrów równą 21.7B. 21.743B, Table 1. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
ViT-22B— kto to stworzył?
Zostało opublikowane przez Google, oparty na United States of America, organizacja sklasyfikowana jako industry.
ViT-22B— kiedy to zostało wydane?
Zostało opublikowane w February 2023. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
ViT-22B— do czego to służy?
Działa w dziedzinie Vision, i jest zarejestrowany jako realizujący zadanie object detection, Image classification. Modele często mają więcej niż jeden z każdego, a etykiety opisują cel, a nie ograniczenia możliwości.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.