OtterHD-8B
Brak oszacowania
Brak wymagań sprzętowych dla tego modelu
Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..
Na nagranie
Pełna specyfikacja
Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- Nanyang Technological University
- Typ organizacji
- Academia
- Kraj
- Singapore
- Opublikowany
- 7 November 2023
- Autorzy
- Bo Li, Peiyuan Zhang, Jingkang Yang, Yuanhan Zhang, Fanyi Pu, Ziwei Liu
Co to robi
Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.
- Domena
- Multimodal, Vision, Language
- Zadanie
- Chat, Visual question answering
- Model bazowy
- Fuyu-8B
Rozmiar
Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- parametry
- 8B
- Dane treningowe
- 200,540,000 tokens
- Epoki
- 3
8B
"We compiled a total of 370K instruction/response pairs sourced from the follow- ing public datasets: LLaVA-Instruct [ 30], VQAv2 [2], GQA [ 23 ], OKVQA [ 36 ], OCRVQA [38 ], A-OKVQA [ 45], COCO-GOI [33 ], COCO-Caption [ 10], TextQA [ 48], RefCOCO [58], COCO-ITM [ 28 ], ImageNet [17 ], and LLaVA-RLHF [ 51 ]."
Obliczenia treningowe
Arytmetyka wykonywana w celu wytrenowania modelu, mierzona w operacjach zmiennoprzecinkowych. Jest to miara kosztów przeprowadzenia treningu, a nie tego, jak szybko gotowy model odpowiada na twoje pytania.
- Dostosowywanie obliczeń
- 2.4 × 10¹⁹ FLOP
flops = (8) * (312 * 10**12) * (3 * 3 * 3600) * (0.3) = 2.4e19 (num gpu) * (peak flops) * (time in seconds) * (assumed utilization rate) 'Our implementation permits the completion of full-parameter training within 3 hours per epoch on 8×A100 GPUs. ' Table 4 indicates 3 epochs for the full finetune.
Przebieg szkolenia
Co fizycznie było potrzebne do treningu: jakie chipy, ile, na jak długo i co to pobierało z sieci.
- Sprzęt do trenowania
- NVIDIA A100
- Zastosowane chipy
- 8
- Czas-chip
- 24
- Czas rzeczywisty
- 9 hours
- Pobór mocy
- 6.3 kW
3 hours per epoch over 3 epochs: 9 hours
Jak jest klasyfikowane
Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.
- Zapisz pewność
- Confident
- Cytaty
- 85
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- OtterHD: A High-Resolution Multi-modality Model
- Ostatnio zaktualizowane
- 25 May 2026
Co oznaczają liczby
Tło
OtterHD-8B został opublikowany przez Nanyang Technological University, w kraju zapisanym jako Singapore, podczas November 2023. Organizacja publikująca jest klasyfikowana jako academia.
Działa w dziedzinie Multimodal, Vision, Language, i jest zapisany jako wykonujący zadanie chat, Visual question answering.
Jego punktem wyjścia był istniejący model podstawowy, Fuyu-8B. Dlatego dzieli ogólny kształt i rozmiar modelu bazowego.
Jego wagi nigdy nie zostały opublikowane, więc można go osiągnąć tylko przez jego dostawcę. Żaden procesor graficzny tego nie zmieni.
Szkolenie i pochodzenie
Został wytrenowany na korpusie około 200,540,000 Tokeny tekstu.
Odpowiedzi
OtterHD-8B — częste pytania
OtterHD-8B— czy jest open weight?
Licencja nigdy nie została zarejestrowana w naszych danych źródłowych. Traktujemy niewskazaną licencję jako zamkniętą, ponieważ niezarejestrowana licencja nie jest na którą można polegać.
OtterHD-8B— ile ma parametrów?
Ma liczbę parametrów równą 8B. 8B. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.
OtterHD-8B— kto to stworzył?
Zostało opublikowane przez Nanyang Technological University, oparty na Singapore, organizacja sklasyfikowana jako academia.
OtterHD-8B— kiedy to zostało wydane?
Zostało opublikowane w November 2023. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.
OtterHD-8B— do czego to służy?
Działa w dziedzinie Multimodal, Vision, Language, i jest zarejestrowany jako realizujący zadanie chat, Visual question answering. Modele często mają więcej niż jeden z każdego, a etykiety opisują cel, a nie ograniczenia możliwości.
OtterHD-8B— Jaką GPU potrzebuję, aby ją uruchomić?
Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.