B2T connection (16L)

Nyitott súlyok LINE Corporation,Tohoku University June 2022

Nincs becslés

Nincs hardver követelmény ennek a modellnek

Ez a modell súlyai nyilvánosak, de a paraméterszámokat nem tették közzé. Minden memória- és sebességszám ebből a számból indul, ezért inkább nem mutatunk semmit, mint egy hamisított becslést..

Nyilvántartásban

Teljes specifikáció

Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
LINE Corporation,Tohoku University
Szervezet típusa
Industry,Academia
Ország
Japan
Közölt
1 June 2022
Szerzők
Sho Takase, Shun Kiyono, Sosuke Kobayashi, Jun Suzuki

Mit csinál

A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.

Tartomány
Language
Feladat
Language modeling/generation, Question answering

Méret

Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.

Képzési adatok
103,000,000 tokens

"We used WikiText-103 (Merity et al., 2017), which consists of a large number of tokens. The training, validation, and test sets contain 103M, 0.2M, and 0.2M tokens, respectively" Table 6 updates: 50K tokens/GPU: 1024 GPUs (Table 7): 192 50000*1024*192/103000000 = 95 epochs

Epochok
95

Képzés számítás

A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.

Képzés számítás
2.8 × 10¹⁹ FLOP

192*7 GPU (P100) hours per Table 6 19 TFLOP/s 19 trillion * 192 * 7 * 3600 * 0.3 = 2.76e19 6 FLOP / parameter / token * 247000000 parameters [not sure how it was estimated] * 50000 steps * 1024 tokens / GPU * 192 GPUs = 1.4568653e+19 FLOP

Hogyan jött létre
Hardware,Operation counting

A tréning futás

Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.

Képzési hardver
NVIDIA P100
Használt chipek
192
Fali óra idő
7 hours
Teljesítményfogyasztás
96.3 kW

Elérhetőség

Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (unrestricted)
Képzés kód
Open source

code and weights, MIT: https://github.com/takase/b2t_connection?tab=readme-ov-file

Hogyan van besorolva

Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.

Nyilvántartási bizalom
Confident
Hivatkozások
18
Benchmark adatok
B2T connection (16L)

Források

Honnan származik ez a felvétel és mikor ellenőrizték utoljára.

Referencia
On Layer Normalizations and Residual Connections in Transformers
Utoljára frissítve
25 May 2026

Mit jelentenek a számok

Háttér

B2T connection (16L) ki lett adva által LINE Corporation,Tohoku University, az országban rögzítve mint Japan, alatt June 2022. A kiadó kategóriája alá tartozik industry,Academia.

Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling/generation, Question answering.

A súlyok közzétéve vannak, így letölthető és futtatható a saját hardveren határozatlan ideig, offline, felhasználói fiók nélkül.

Képzés és származás

A képzés futás körülbelül 2.8 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.

Körülbelül egy korpuszon lett betanítva 103,000,000 szöveg tokenjei

Válaszok

B2T connection (16L) — gyakori kérdések

01

B2T connection (16L)— Hol tudom letölteni?

A súlyok közzététele megtörtént, bár nem rendelkezünk tárolólinkkel erre. Ez az oldal a hardverkövetelményeket számítja ki, nem pedig modellfájlokat tárol.

02

B2T connection (16L)— mennyi számítási kapacitást használtak annak a betanításához?

A képzés körülbelül elfogyasztott 2.8 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA P100. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.

03

B2T connection (16L)— Milyen GPU-ra van szükségem, hogy futtathassam?

Nem tudjuk megmondani. Nyílt súlyai vannak, de a paraméterek számát nem tették közzé, és minden memória- és sebességszámítás ebből a számból indul. Inkább nem mutatunk semmit, mint egy hamisított becslést.

04

B2T connection (16L)— Nyílt forráskódú?

Súlyai közzétételre kerültek, így letölthető és futtatható a saját hardvereden. Ne feledd, hogy az open weight nem azonos az open source teljes értelmében — nem mond semmit a tanulási adatokkal, a tanulási kóddal vagy a kereskedelmi feltételekkel kapcsolatban.

05

B2T connection (16L)— Hány paramétere van?

Nincs közzétéve paraméterszám, ezért ez az oldal nem tartalmaz memóriával vagy sebességgel kapcsolatos adatokat.

06

B2T connection (16L)— Ki készítette ezt?

Kiadta LINE Corporation,Tohoku University, alapján Japan, egy szervezet, amelyet kategorizáltak mint industry,Academia.

07

B2T connection (16L)— Mikor adták ki?

Kibocsátották a June 2022. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.

08

B2T connection (16L)— Mire használják?

Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling/generation, Question answering. A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.

Forrás

Eredeti kiadvány

Az utolsó frissítés időpontja 25 May 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..