SILC-S* (86M)
Brak szacunków
Brak wymagań sprzętowych dla tego modelu
Wagi tego modelu nie zostały opublikowane, dlatego nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny wyłącznie poprzez jego dostawcę, a żadna karta graficzna tego nie zmieni.
Na nagraniu
Pełna specyfikacja
Wszystko, co jest dostępne na temat tego modelu. Większość z tego opisuje, jak został wytrenowany, a nie jak działa — przydatny kontekst do oceny, ile pracy w to włożono i jak wypada na tle modeli zbudowanych na innym poziomie skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- ETH Zurich,DeepMind,Google,Technical University of Munich
- Typ organizacji
- Academia,Industry,Industry,Academia
- Kraj
- Switzerland, United Kingdom of Great Britain and Northern Ireland, United States of America, Germany
- Opublikowane
- 20 October 2023
- Autorzy
- Muhammad Ferjad Naeem, Yongqin Xian, Xiaohua Zhai, Lukas Hoyer, Luc Van Gool, Federico Tombari
Co to robi
Obszary problemowe, dla których stworzono model. Model może zawierać kilka z każdej.
- Domena
- Vision
- Zadanie
- Image classification, Image segmentation
Rozmiar
Jakiej wielkości jest model i na ile danych był szkolony. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- Parametry
- 86M
- Dane treningowe
- tokens
- Batch size
- 16,000
"SILC models set a new state-of-the-art for these tasks at ViT/B16 model size" (https://arxiv.org/pdf/2310.13355, page 5). VIT/B16-224 has 86.6M parameters, and VIT/B16-384 has 86.9M parameters (https://huggingface.co/google/vit-base-patch16-224, https://huggingface.co/google/vit-base-patch16-384), so I will assume SILC-S has 86M parameters.
SILC-S* saw 20B examples of image-text pairs during training (https://www.ecva.net/papers/eccv_2024/papers_ECCV/papers/03093-supp.pdf, page 4).
"We trained with a batch size of 16k on Google TPUs" (https://arxiv.org/pdf/2310.13355, page 5).
Obliczenia szkoleniowe
Aritmetyka wykonywana w celu wytrenowania modelu, mierzone w operacjach zmiennoprzecinkowych. Jest to miara kosztu przeprowadzonego treningu, a nie tego, jak szybko gotowy model odpowiada na twoje zapytania.
- Obliczenia szkoleniowe
- 1 × 10²² FLOP
"SILC* at ViT B/16 can be trained on 256 TPUv4 chips meanwhile the B/8 and L/16 models require 512 chips. The training takes around 5 days" (https://www.ecva.net/papers/eccv_2024/papers_ECCV/papers/03093-supp.pdf, page 7). Assuming a 33% utilization rate, Training compute = utilization rate * # of chips used * peak FLOPS / chip * training time = 0.33 * 256 TPUv4 chip * 2.75e14 FLOPS / TPUv4 chip * 5 days * 24 h / day * 3600 s / h ~= 1.004e22 FLOPS
Trening
Co fizycznie zajęło szkolenie: które chipy, ile ich, na jak długo i ile to pobrało z sieci.
- Sprzęt szkoleniowy
- Google TPU v4
- Chips użyte
- 256
- Wall-clock time
- 120 hours
- Pobór mocy
- 172.8 kW
"SILC* at ViT B/16 can be trained on 256 TPUv4 chips meanwhile the B/8 and L/16 models require 512 chips. The training takes around 5 days" (https://www.ecva.net/papers/eccv_2024/papers_ECCV/papers/03093-supp.pdf, page 7).
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim własnym sprzęcie, co decyduje, czy jakiekolwiek z danych dotyczących karty graficznej na tej stronie mają zastosowanie.
- Wagi
- Closed — provider access only
- Dostęp do modelu
- Unreleased
- Kod treningowy
- Unreleased
Jak jest klasyfikowane
Etykiety stosowane przez źródłowy zbiór danych podczas śledzenia znaczących modeli oraz jak pewny jest w danym wpisie.
- Zaufanie do nagrania
- Confident
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- SILC: Improving Vision Language Pretraining with Self-Distillation
- Ostatnia aktualizacja
- 11 February 2026
Co oznaczają liczby
O tym modelu
SILC-S* (86M) was published by ETH Zurich,DeepMind,Google,Technical University of Munich, in Switzerland, in October 2023. academia,Industry,Industry,Academia is the category the publisher falls under.
It works in Vision, and is recorded as doing image classification, Image segmentation.
To jest model zamknięty: wytrenowane wartości pozostały u tych, którzy je wyprodukowali, i nie ma lokalnej wersji do uruchomienia.
Jak to było trenowane
Producing it required around 1 × 10²² FLOP of arithmetic, on Google TPU v4, which is a statement about the training budget rather than about inference.
Odpowiedzi
SILC-S* (86M) — Często zadawane pytania
How much compute was used to train SILC-S* (86M)?
Około 1 × 10²² FLOP, na Google TPU v4. To mierzy, ile kosztowało wyprodukowanie modelu i nie mówi nic o tym, jak szybko odpowiada po wytrenowaniu — prędkość wnioskowania pochodzi z przepustowości pamięci, a nie z budżetu szkoleniowego.
What GPU do I need to run SILC-S* (86M)?
None. SILC-S* (86M) is a closed model — its weights were never published, so it cannot be downloaded or run on your own hardware at any price. It is reachable only through its provider.
Is SILC-S* (86M) open source?
No. SILC-S* (86M) has not had its weights published, so it exists only as a service controlled by its owner.
How many parameters does SILC-S* (86M) have?
SILC-S* (86M) has 86M parameters. "SILC models set a new state-of-the-art for these tasks at ViT/B16 model size" (https://arxiv.org/pdf/2310.13355, page 5). VIT/B16-224 has 86.6M parameters, and VIT/B16-384 has 86.9M parameters (https://huggingface.co/google/vit-base-patch16-224, https://huggingface.co/google/vit-base-patch16-384), so I will assume SILC-S has 86M parameters. That figure is the total, and it is what decides how much memory the model needs — roughly half a gigabyte per billion at the compression most people use.
Who created SILC-S* (86M)?
SILC-S* (86M) was published by ETH Zurich,DeepMind,Google,Technical University of Munich, based in Switzerland, categorised as academia,Industry,Industry,Academia.
When was SILC-S* (86M) released?
SILC-S* (86M) was published in October 2023. Capability per parameter has improved considerably since, so a newer model of the same size is often the better use of the same hardware.
What is SILC-S* (86M) used for?
SILC-S* (86M) works in Vision, and is recorded as handling image classification, Image segmentation. Models frequently carry more than one of each, and the tags describe purpose rather than capability limits.
W innym kierunku
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, wszystko co będzie ona obsługiwać, Rozpocznij od sprzętu..