BitNet b1.58
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- University of Chinese Academy of Sciences,Microsoft Research
- Szervezet típusa
- Academia,Industry
- Ország
- China, United States of America
- Közölt
- 27 February 2024
- Szerzők
- Shuming Ma, Hongyu Wang, Lingxiao Ma, Lei Wang, Wenhui Wang, Shaohan Huang, Li Dong, Ruiping Wang, Jilong Xue, Furu Wei
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Language modeling/generation, Question answering
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 70B
- Képzési adatok
- 100,000,000,000 tokens
"we pre-trained the models on the RedPajama dataset [Com23] for 100 billion tokens."
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 2.9 × 10²² FLOP
- Hogyan jött létre
- Operation counting,Comparison with other models
6ND = 6*70*10^9*100*10^9 = 42000000000000000000000 (4.2e+22) Figure 3 suggests it 41.2 times more energy efficient than LLAMA 70B (which is estimated 8.1e+23 FLOPS -> 1.9660194e+22 FLOPs geometric mean -> 2.8735486e+22
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Nyilvántartási bizalom
- Confident
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
- Utoljára frissítve
- 28 November 2025
Mit jelentenek a számok
Mit jelent ez a modell
BitNet b1.58 ki lett adva által University of Chinese Academy of Sciences,Microsoft Research, az országban rögzítve mint China, alatt February 2024. Egy olyan szervezetből származik, amelyet kategorizálnak mint academia,Industry.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling/generation, Question answering.
Mivel a súlyok nem elérhetők, ezért ezen az oldalon máshol található hardveradatok egyike sem vonatkozik rá.
Képzés és származás
A betanításhoz körülbelül egy számítási költségvetés kellett 2.9 × 10²² FLOP. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
Körülbelül egy korpuszon lett betanítva 100,000,000,000 szöveg tokenjei
Válaszok
BitNet b1.58 — gyakori kérdések
BitNet b1.58— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
BitNet b1.58— Nyílt forráskódú?
A licencálás sosem volt rögzítve a forrásadatainkban. Az állandóan nem megadott licencet zártnak tekintjük, mert a nem rögzített licenc nem egy megbízható.
BitNet b1.58— Hány paramétere van?
Paraméterszáma 70B. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
BitNet b1.58— Ki készítette ezt?
Kiadta University of Chinese Academy of Sciences,Microsoft Research, alapján China, egy szervezet, amelyet kategorizáltak mint academia,Industry.
BitNet b1.58— Mikor adták ki?
Kibocsátották a February 2024. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
BitNet b1.58— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling/generation, Question answering. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.
BitNet b1.58— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 2.9 × 10²² FLOP. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..