VALL-E X
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Microsoft
- Szervezet típusa
- Industry
- Ország
- United States of America
- Közölt
- 7 March 2023
- Szerzők
- Ziqiang Zhang, Long Zhou, Chengyi Wang, Sanyuan Chen, Yu Wu, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, Furu Wei
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Speech
- Feladat
- Translation, Speech synthesis, Speech recognition (ASR), Speech-to-speech
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 700M
- Képzési adatok
- 151,200,000,000 tokens
"For the cross-lingual codec language models, φMAR and φMNAR are both 12-layer Transformer decoders with an attention dimension of 1024 and the FFN dimension of 4096." These are two parts of the model. According to Ben's script, that's 353M parameters, or ~700M for both (https://github.com/bencottier/ml-parameter-count/blob/main/parameter_count.py)
70k hours, encoded by an 8 layer EnCodec, where each layer generates 75 encodings per second of 24 kHz audio. 70k hr * 3600 sec/hr * 75/sec = 18.9B audio encodings per layer φMAR is trained to autoregressively predict the each subsequent token in the first layer of encodings. φMNAR is trained to predict the remaining acoustic embedding layers after being shown both the first layer of the current input and the full set of embeddings from a previous sentence. Based on this, the total number of …
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 1.2 × 10²¹ FLOP
- Hogyan jött létre
- Operation counting
" The batch sizes of speech and phonemes on each GPU are 1,400,000 (87.5 seconds) and 3,000, respectively. The maximum learning rate is 5e-4 with warm-up steps of 32,000. The model is pre-trained on 32 V100 GPUs for 400K step" 6CN: 6 * (1.4M + 3000) * 353M * 400k = 1.2e21 (2 OOM larger than our estimate for VALL-E, and would take ~46 days on the V100 cluster at 30% utilization. Seems perhaps a bit high?)
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA V100
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Closed — provider access only
- Modell hozzáférés
- Unreleased
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Nyilvántartási bizalom
- Likely
- Hivatkozások
- 262
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling
- Utoljára frissítve
- 25 May 2026
Mit jelentenek a számok
Erről a modelről
VALL-E X ki lett adva által Microsoft, az országban rögzítve mint United States of America, alatt March 2023. A kiadó szervezet a következő kategóriába tartozik industry.
Működik a területen a Speech, és úgy van rögzítve, mint a feladat végrehajtása translation, Speech synthesis, Speech recognition (ASR), Speech-to-speech.
Ez egy zárt modell: a betanított értékek azoknál maradtak, akik előállították őket, és nincs helyi verzió a futtatáshoz.
Mi került a felépítésébe
A betanításhoz körülbelül egy számítási költségvetés kellett 1.2 × 10²¹ FLOP, hardveren rögzítve NVIDIA V100. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
Körülbelül egy korpuszon lett betanítva 151,200,000,000 szöveg tokenjei
Válaszok
VALL-E X — gyakori kérdések
VALL-E X— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
VALL-E X— Nyílt forráskódú?
Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.
VALL-E X— Hány paramétere van?
Paraméterszáma 700M. "For the cross-lingual codec language models, φMAR and φMNAR are both 12-layer Transformer decoders with an attention dimension of 1024 and the FFN dimension of 4096." These are two parts of the model. According to Ben's script, that's 353M parameters, or ~700M for both (https://github.com/bencottier/ml-parameter-count/blob/main/parameter_count.py). Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
VALL-E X— Ki készítette ezt?
Kiadta Microsoft, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.
VALL-E X— Mikor adták ki?
Kibocsátották a March 2023. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
VALL-E X— Mire használják?
Működik a területen a Speech, és rögzítve van, hogy kezeli a feladatot translation, Speech synthesis, Speech recognition (ASR), Speech-to-speech. Ezek azok a területek, amelyek köré tervezték; ezek a szándékot írják le, nem pedig egy szigorú határt.
VALL-E X— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 1.2 × 10²¹ FLOP, hardveren rögzítve NVIDIA V100. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..