Fish-Speech 1.4
Nincs becslés
Nincs hardver követelmény ennek a modellnek
Ez a modell súlyai nyilvánosak, de a paraméterszámokat nem tették közzé. Minden memória- és sebességszám ebből a számból indul, ezért inkább nem mutatunk semmit, mint egy hamisított becslést..
Nyilvántartásban
Teljes specifikáció
Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..
Eredet
Ki építette ezt a modellt, hol, és mikor publikálták.
- Szervezet
- Fish Audio
- Szervezet típusa
- Industry
- Ország
- United States of America
- Közölt
- 9 November 2024
- Szerzők
- Shijia Liao, Yuxuan Wang, Tianyu Li, Yifan Cheng, Ruoyi Zhang, Rongzhi Zhou, Yijin Xing
Mit csinál
A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.
- Tartomány
- Speech
- Feladat
- Speech synthesis, Text-to-speech (TTS)
Méret
Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.
- Képzési adatok
- 500,000,000,000 tokens
[tokens] "The dataset contains about 720,000 hours of speech across different languages, with 300,000 hours each of English and Mandarin Chinese as the main components. We also included 20,000 hours each of other language families: Germanic (German), Romance (French, Italian), East Asian (Japanese, Korean), and Semitic (Arabic)." • Batch size: 1M tokens • Training steps: 500K 10^6 * 500000 = 5*10^11 tokens
Képzés számítás
A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.
- Képzés számítás
- 1.9 × 10²¹ FLOP
- Hogyan jött létre
- Hardware
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week. Note that these timelines exclude the DPO stage." (989400000000000 FLOP / GPU / sec [H100, bf16 assumed] + 330000000000000 FLOP / GPU / sec [4090, bf16 assumed]) * 8 GPUs * 168 hours * 3600 sec / hour * 0.3 [assumed utilization] = 1.9151355e+21 FLOP
A tréning futás
Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.
- Képzési hardver
- NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090
- Használt chipek
- 8
- Fali óra idő
- 168 hours (7 days)
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week" 1 week = 168 hours
Elérhetőség
Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.
- Súlyok
- Open — downloadable
- Modell hozzáférés
- Open weights (non-commercial)
- Képzés kód
- Open source
- Hugging Face
- fishaudio
This codebase is released under Apache License and all model weights are released under CC-BY-NC-SA-4.0 License https://github.com/fishaudio/fish-speech/tree/main/fish_speech https://huggingface.co/fishaudio/fish-speech-1.4
Hogyan van besorolva
Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.
- Nyilvántartási bizalom
- Confident
Források
Honnan származik ez a felvétel és mikor ellenőrizték utoljára.
- Referencia
- Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
- Utoljára frissítve
- 28 November 2025
Mit jelentenek a számok
Honnan jött
Fish-Speech 1.4 ki lett adva által Fish Audio, az országban rögzítve mint United States of America, alatt November 2024. A kiadó szervezet a következő kategóriába tartozik industry.
Működik a területen a Speech, és úgy van rögzítve, mint a feladat végrehajtása speech synthesis, Text-to-speech (TTS).
Mivel a súlyai ki lettek adva, semmi sem függ attól, hogy egy szolgáltató elérhető marad-e - a tiéd, amint letöltötted. A Hugging Face-en az alábbi szervezet alatt van publikálva fishaudio.
Mi került a felépítésébe
A betanításhoz körülbelül egy számítási költségvetés kellett 1.9 × 10²¹ FLOP, hardveren rögzítve NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.
Körülbelül egy korpuszon lett betanítva 500,000,000,000 szöveg tokenjei
Válaszok
Fish-Speech 1.4 — gyakori kérdések
Fish-Speech 1.4— Mikor adták ki?
Kibocsátották a November 2024. A paraméterenkénti képesség lényegesen javult azóta, így egy újabb, azonos méretű modell gyakran jobb felhasználása a same hardvernek.
Fish-Speech 1.4— Mire használják?
Működik a területen a Speech, és rögzítve van, hogy kezeli a feladatot speech synthesis, Text-to-speech (TTS). A modell több mindenből is képes cipelni, így ezek azok a területek, amelyekre épült, nem pedig egy korlát arra, amit meg fog próbálni.
Fish-Speech 1.4— Hol tudom letölteni?
Súlyait a Hugging Face-en tette közzé, a szervezet alatt fishaudio. Nem tárolunk modell fájlokat — ez az oldal kiszámolja, hogy milyen hardver szükséges a futtatásukhoz.
Fish-Speech 1.4— mennyi számítási kapacitást használtak annak a betanításához?
A képzés körülbelül elfogyasztott 1.9 × 10²¹ FLOP, hardveren rögzítve NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.
Fish-Speech 1.4— Milyen GPU-ra van szükségem, hogy futtathassam?
Nem tudjuk megmondani. Nyílt súlyai vannak, de a paraméterek számát nem tették közzé, és minden memória- és sebességszámítás ebből a számból indul. Inkább nem mutatunk semmit, mint egy hamisított becslést.
Fish-Speech 1.4— Nyílt forráskódú?
Súlyai közzétételre kerültek, így letölthető és futtatható a saját hardvereden. Ne feledd, hogy az open weight nem azonos az open source teljes értelmében — nem mond semmit a tanulási adatokkal, a tanulási kóddal vagy a kereskedelmi feltételekkel kapcsolatban.
Fish-Speech 1.4— Hány paramétere van?
Nincs közzétéve paraméterszám, ezért ez az oldal nem tartalmaz memóriával vagy sebességgel kapcsolatos adatokat.
Fish-Speech 1.4— Ki készítette ezt?
Kiadta Fish Audio, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.
A másik irány
Másik oldalról nézve?
Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..