Xinyu
Nincs becslés
Nincs hardver követelmény ennek a modellnek
A modellhez tartozó súlyokat nem tették közzé, így nem tölthető le vagy futtatható a saját hardverén bármilyen méretben. Csak a szolgáltatóján keresztül érhető el, és egyetlen grafikus kártya sem változtat ezen..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Zhejiang University (ZJU),Institute for Advanced Algorithms Research,Northeastern University (China),China Telecom,State Key Laboratory of Media Convergence Production Technology and Systems
- Szervezet típusa
- Academia,Academia,Academia,Industry,Academia
- Ország
- China
- Közölt
- 23 August 2024
- Szerzők
- Yiquan Wu, Bo Tang, Chenyang Xi, Yu Yu, Pengyu Wang, Yifei Liu, Kun Kuang, Haiying Deng, Zhiyu Li, Feiyu Xiong, Jie Hu, Peng Cheng, Zhonghao Wang, Yi Wang, Yi Luo, Mingchuan Yang
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Language
- Feladat
- Language modeling/generation
- Alapmodell
- Llama 2-13B
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Paraméterek
- 13B
- Képzési adatok
- 500,000,000 tokens
"we continued pre-training on LLaMA13B using a corpus comprising 500B tokens, which contains both English and Chinese corpus."
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Hogyan jött létre
- Hardware,Operation counting
- Finomhangolás számítás
- 2.9 × 10²² FLOP
pre-training: 312000000000000 FLOP / GPU / sec [A800 80GB reported, bf 16 assumed] * 128 GPUs * 20 days * 24 hours / day * 3600 sec / hour * 0.3 [assumed utilization] = 2.0702822e+22 FLOP SFT: 312000000000000 FLOP / GPU / sec [A800 80GB reported, bf 16 assumed] * 8 GPUs * 2 days * 24 hours / day * 3600 sec / hour * 0.3 [assumed utilization] = 1.2939264e+20 FLOP Total: 2.0832215e+22 FLOP 6 FLOP / token / parameter * 13 * 10^9 parameters * 500 * 10^9 tokens = 3.9e+22 FLOP sqrt(3.9e+22*2.083…
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA A800 PCIe 80 GB
- Használt chipek
- 128
- Fali óra idő
- 528 hours (22 days)
- Teljesítményfogyasztás
- 63.1 kW
"The continued pre-training phase lasted 20 days on 128 Nvidia A800 80G GPUs, while the supervised fine-tuning (SFT) process took 2 days on 8 Nvidia A800 80G GPUs."
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Closed — provider access only
- Modell hozzáférés
- Unreleased
- Képzés kód
- Unreleased
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Nyilvántartási bizalom
- Confident
- Hivatkozások
- 5
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Xinyu: An Efficient LLM-based System for Commentary Generation
- Utoljára frissítve
- 28 November 2025
Mit jelentenek a számok
Mit jelent ez a modell
Xinyu ki lett adva által Zhejiang University (ZJU),Institute for Advanced Algorithms Research,Northeastern University (China),China Telecom,State Key Laboratory of Media Convergence Production Technology and Systems, az országban rögzítve mint China, alatt August 2024. A kiadó szervezet a következő kategóriába tartozik academia,Academia,Academia,Industry,Academia.
Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling/generation.
Ez alapoz. Llama 2-13B. A legtöbb modell ezen a skálán egy meglévő alaphoz van igazítva, ahelyett, hogy semmiből épült volna.
Mivel a súlyok nem elérhetők, ezért ezen az oldalon máshol található hardveradatok egyike sem vonatkozik rá.
Hogyan lett betanítva
Körülbelül egy korpuszon lett betanítva 500,000,000 szöveg tokenjei
Válaszok
Xinyu — gyakori kérdések
Xinyu— Ki készítette ezt?
Kiadta Zhejiang University (ZJU),Institute for Advanced Algorithms Research,Northeastern University (China),China Telecom,State Key Laboratory of Media Convergence Production Technology and Systems, alapján China, egy szervezet, amelyet kategorizáltak mint academia,Academia,Academia,Industry,Academia.
Xinyu— Mikor adták ki?
Kibocsátották a August 2024. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
Xinyu— Mire használják?
Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling/generation. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.
Xinyu— Milyen GPU-ra van szükségem, hogy futtathassam?
Ez egy zárt modell — a súlyait soha nem tették közzé, így nem tölthető le és nem futtatható a saját hardverén semmilyen áron. Csak a szolgáltatóján keresztül érhető el.
Xinyu— Nyílt forráskódú?
Nem. A súlyai nincsenek közzétéve, így csak a tulajdonosa által ellenőrzött szolgáltatásként létezik.
Xinyu— Hány paramétere van?
Paraméterszáma 13B. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..