DeepSpeech2 (English)
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Baidu Research - Silicon Valley AI Lab
- Szervezet típusa
- Industry
- Ország
- United States of America
- Közölt
- 8 December 2015
- Szerzők
- Dario Amodei, Rishita Anubhai, Eric Battenberg, Carl Case, Jared Casper, Bryan Catanzaro, Jingdong Chen, Mike Chrzanowski, Adam Coates, Greg Diamos, Erich Elsen, Jesse Engel, Linxi Fan, Christopher Fougner, Tony Han, Awni Hannun, Billy Jun, Patrick LeGresley, Libby Lin, Sharan Narang, Andrew Ng, Sherjil Ozair, Ryan Prenger, Jonathan Raiman, Sanjeev Satheesh, David Seetapun, Shubho Sengupta, Yi Wan…
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Speech
- Feladat
- Speech recognition (ASR)
- Numerikus formátum
- FP32
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 38M
- Képzési adatok
- 716,400,000 tokens
All networks have 38 million parameters.
"Our English speech system is trained on 11,940 hours of speech, while the Mandarin system is trained on 9,400 hours." 11,940 * 13,680 = 163339200
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 2.6 × 10¹⁹ FLOP
- Hogyan jött létre
- Operation counting,Third-party estimation
1 timestep = (1280 hidden units)^2 * (7 RNN layers * 4 matrices for bidirectional + 2 DNN layers) * (2 for doubling parameters from 36M to 72M) = 98 MFLOP 20 epochs * 12,000 hours * 3600 seconds/hour * 50 samples/sec * 98 MFLOP * 3 add-multiply * 2 backprop = 26,000 PF = 0.30 pfs-days See also AI and Compute by Dario Amodei and OpenAI https://openai.com/research/ai-and-compute
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA GeForce GTX TITAN X
- Használt chipek
- 16
- Chip-óra
- 1,920
- Fali óra idő
- 120 hours
- Hardverhasználat
- HFU 46.7%
- Teljesítményfogyasztás
- 8.5 kW
- Számítási költség
- $214
"5 days" from AI and Compute https://openai.com/index/ai-and-compute/
"Overall the system sustains approximately 50 teraFLOP/second when training on 16 GPUs. This amounts to 3 teraFLOP/second per GPU which is about 50% of peak theoretical performance" HFU = (50/16) TFLOP / 6.69 TFLOP = 0.4670
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Határmodell
- Yes
- Nyilvántartási bizalom
- Confident
- Hivatkozások
- 3,150
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Deep Speech 2: End-to-End Speech Recognition in English and Mandarin
- Utoljára frissítve
- 25 May 2026
Mit jelentenek a számok
Erről a modelről
DeepSpeech2 (English) ki lett adva által Baidu Research - Silicon Valley AI Lab, az országban rögzítve mint United States of America, alatt December 2015. A kiadó kategóriája alá tartozik industry.
Működik a területen a Speech, és úgy van rögzítve, mint a feladat végrehajtása speech recognition (ASR).
Ez egy zárt modell: a betanított értékek azoknál maradtak, akik előállították őket, és nincs helyi verzió a futtatáshoz.
Mi került a felépítésébe
A betanításhoz körülbelül egy számítási költségvetés kellett 2.6 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA GeForce GTX TITAN X. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
A képzés körülbelül egy korpuszt fogyasztott 716,400,000 szöveg tokenjei
Válaszok
DeepSpeech2 (English) — gyakori kérdések
DeepSpeech2 (English)— Ki készítette ezt?
Kiadta Baidu Research - Silicon Valley AI Lab, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.
DeepSpeech2 (English)— Mikor adták ki?
Kibocsátották a December 2015. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
DeepSpeech2 (English)— Mire használják?
Működik a területen a Speech, és rögzítve van, hogy kezeli a feladatot speech recognition (ASR). A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.
DeepSpeech2 (English)— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 2.6 × 10¹⁹ FLOP, hardveren rögzítve NVIDIA GeForce GTX TITAN X. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
DeepSpeech2 (English)— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
DeepSpeech2 (English)— Nyílt forráskódú?
A licencálás sosem volt rögzítve a forrásadatainkban. Az állandóan nem megadott licencet zártnak tekintjük, mert a nem rögzített licenc nem egy megbízható.
DeepSpeech2 (English)— Hány paramétere van?
Paraméterszáma 38M. All networks have 38 million parameters. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..