Flamingo
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- DeepMind
- Typ organizacji
- Industry
- Kraj
- United Kingdom of Great Britain and Northern Ireland
- Opublikowany
- 29 April 2022
- Autorzy
- Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zi…
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Multimodal, Vision, Language, Video
- Zadanie
- Visual question answering, Image captioning
- Podejście
- Supervised
- Model bazowy
- Chinchilla
- Format numeryczny
- BF16
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 80B
- Dane treningowe
- 458,333,333,333 tokens
"We obtain three models, Flamingo-3B, Flamingo-9B and Flamingo-80B" " The Flamingo-80B model builds on top of the frozen Chinchilla 70B language model [42]. Starting from the very first layer and before every seventh transformer blocks, we add a GATED XATTN-DENSE layer attending to the visual inputs; this accounts for 10B additional learned parameters. For simplicity, we refer to this model as simply Flamingo throughout the paper"
Flamingo was trained on a mixture of web-scraped datasets: 43M pages of text with interleaved images (MultiModal MassiveWeb dataset) 312M image-text pairs (LTIP dataset) 27M video-text pairs (VTP dataset) 1.8B image-alt text pairs (ALIGN dataset) Training dataset size is at least 2.1 billion.
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Obliczenia treningowe
- 2.2 × 10²³ FLOP
- Jak to zostało ustalone
- Hardware
1536 TPU v4 chips for 15 days. Assuming 40% utilization: C = 1536 TPU * 275*10^12 FLOP/s/TPU * 15 day * 86400 s/day * 0.40 = 2.2*10^23 FLOP "All training and evaluation was performed on TPUv4 instances. The largest model containing 80 billion parameters is trained on QUSV chips for 15 days and sharded across 16 devices." "All trained parameters and optimizer accumulators are stored and updated in float32; all activations and gradients are computed in bfloat16 after downcasting of parameters fr…
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- Google TPU v4
- Zastosowane chipy
- 1,536
- Czas-chip
- 552,960
- Czas rzeczywisty
- 360 hours (15 days)
- Pobór mocy
- 1.0 MW
- Koszt obliczeniowy
- $183,423
1536 TPU v4 chips for 15 days
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim sprzęcie, co decyduje o tym, czy którakolwiek z cyfr karty graficznej na tej stronie ma zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- Unreleased
- Kod treningowy
- Unreleased
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Model bazowy
- Yes
- Prawdopodobnie powyżej 10²³ FLOP
- Yes
- Dlaczego to jest śledzone
- SOTA improvement,Discretionary
- Zapisz pewność
- Confident
- Cytaty
- 5,793
Figure 2 "For tasks lying anywhere on this spectrum, a single Flamingo model can achieve a new state of the art with few-shot learning, simply by prompting the model with task-specific examples. On numerous benchmarks, Flamingo outperforms models fine-tuned on thousands of times more task-specific data."
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- Flamingo: a Visual Language Model for Few-Shot Learning
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
Skąd to pochodzi
Flamingo został opublikowany przez DeepMind, w kraju zapisanym jako United Kingdom of Great Britain and Northern Ireland, podczas April 2022. Wychodzi z organizacji zaklasyfikowanej jako industry.
Działa w dziedzinie Multimodal, Vision, Language, Video, i jest zapisany jako wykonujący zadanie visual question answering, Image captioning.
Zamiast być trenowanym od podstaw, pochodzi z Chinchilla. Dlatego dzieli ogólny kształt i rozmiar modelu bazowego.
Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żaden procesor graficzny tego nie zmieni.
Szkolenie i pochodzenie
Trening zajmował około 2.2 × 10²³ FLOP, na sprzęcie zarejestrowanym jako Google TPU v4. Ta liczba mierzy, ile kosztowało wyprodukowanie modelu i nie ma wpływu na to, jak szybko odpowiada.
Został wytrenowany na korpusie około 458,333,333,333 Tokeny tekstu.
Powód, dla którego w ogóle pojawia się w tym katalogu: sOTA improvement,Discretionary.
Odpowiedzi
Flamingo — częste pytania
Flamingo— kto to stworzył?
Zostało opublikowane przez DeepMind, oparty na United Kingdom of Great Britain and Northern Ireland, organizacja sklasyfikowana jako industry.
Flamingo— kiedy to zostało wydane?
Zostało opublikowane w April 2022. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
Flamingo— do czego to służy?
Działa w dziedzinie Multimodal, Vision, Language, Video, i jest zarejestrowany jako realizujący zadanie visual question answering, Image captioning. To są obszary, wokół których został zaprojektowany; opisują zamiar, a nie twardą granicę.
Flamingo— ile mocy obliczeniowej użyto do jego trenowania?
Szkolenie zajęło około 2.2 × 10²³ FLOP, na sprzęcie zarejestrowanym jako Google TPU v4. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z SZEROKOŚCI PASMA, a nie z budżetu treningowego.
Flamingo— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
Flamingo— czy jest open weight?
Nie. Jego wagi nie zostały opublikowane, więc istnieje tylko jako usługa kontrolowana przez jego właściciela.
Flamingo— ile ma parametrów?
Ma liczbę parametrów równą 80B. "We obtain three models, Flamingo-3B, Flamingo-9B and Flamingo-80B" " The Flamingo-80B model builds on top of the frozen Chinchilla 70B language model [42]. Starting from the very first layer and before every seventh transformer blocks, we add a GATED XATTN-DENSE layer attending to the visual inputs; this accounts for 10B additional learned parameters. For simplicity, we refer to this model as simply Flamingo throughout the paper". Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.