Fish-Speech 1.4
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti tohoto modelu jsou otevřené, ale žádný počet parametrů pro něj nebyl zveřejněn. Každé číslo týkající se paměti a rychlosti vychází z této hodnoty, takže bychom raději nic neukázali, než fabrikaovaný odhad..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Fish Audio
- Typ organizace
- Industry
- Země
- United States of America
- Publikováno
- 9 November 2024
- Autoři
- Shijia Liao, Yuxuan Wang, Tianyu Li, Yifan Cheng, Ruoyi Zhang, Rongzhi Zhou, Yijin Xing
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Speech
- Úkol
- Speech synthesis, Text-to-speech (TTS)
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- Výcviková data
- 500,000,000,000 tokens
[tokens] "The dataset contains about 720,000 hours of speech across different languages, with 300,000 hours each of English and Mandarin Chinese as the main components. We also included 20,000 hours each of other language families: Germanic (German), Romance (French, Italian), East Asian (Japanese, Korean), and Semitic (Arabic)." • Batch size: 1M tokens • Training steps: 500K 10^6 * 500000 = 5*10^11 tokens
Výpočty pro trénink
Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.
- Výpočty pro trénink
- 1.9 × 10²¹ FLOP
- Jak bylo ustanoveno
- Hardware
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week. Note that these timelines exclude the DPO stage." (989400000000000 FLOP / GPU / sec [H100, bf16 assumed] + 330000000000000 FLOP / GPU / sec [4090, bf16 assumed]) * 8 GPUs * 168 hours * 3600 sec / hour * 0.3 [assumed utilization] = 1.9151355e+21 FLOP
Tréninkový běh
Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.
- Tréninkový hardware
- NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090
- Používané čipy
- 8
- Doba reálného času
- 168 hours (7 days)
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week" 1 week = 168 hours
Dostupnost
Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.
- Hmotnosti
- Open — downloadable
- Přístup k modelu
- Open weights (non-commercial)
- Tréninkový kód
- Open source
- Hugging Face
- fishaudio
This codebase is released under Apache License and all model weights are released under CC-BY-NC-SA-4.0 License https://github.com/fishaudio/fish-speech/tree/main/fish_speech https://huggingface.co/fishaudio/fish-speech-1.4
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Záznam důvěry
- Confident
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
Odkud to přišlo
Fish-Speech 1.4 byl zveřejněn Fish Audio, v zemi zaznamenané jako United States of America, během November 2024. Vydavatelská organizace je kategorizována jako industry.
funguje v oblasti Speech, a je zaznamenán jako vykonávající úkol speech synthesis, Text-to-speech (TTS).
Protože byly jeho váhy uvolněny, nic ohledně jeho spuštění nezávisí na dostupnosti poskytovatele - je to vaše, jakmile je stáhnuto. Na Hugging Face je publikováno pod organizací fishaudio.
Co bylo zapotřebí k jeho vybudování
Trénování si vyžádalo výpočetní rozpočet přibližně 1.9 × 10²¹ FLOP, na hardwaru zaznamenáno jako NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.
Bylo to trénováno na korpusu asi 500,000,000,000 tokeny textu
Odpovědi
Fish-Speech 1.4 — běžné otázky
Fish-Speech 1.4— Kdy byl vydán?
Bylo to zveřejněno v November 2024. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
Fish-Speech 1.4— K čemu se to používá?
funguje v oblasti Speech, a je zaznamenáno jako zpracovávající úkol speech synthesis, Text-to-speech (TTS). Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.
Fish-Speech 1.4— kde si to mohu stáhnout?
Jeho váhy jsou publikovány na Hugging Face, pod organizací fishaudio. Na našem webu nenabízíme soubory modelů — tento web vypočítává, jaký hardware je potřebný pro jejich spuštění.
Fish-Speech 1.4— kolik výpočetního výkonu bylo použito k jeho trénování?
Trénink spotřeboval kolem 1.9 × 10²¹ FLOP, na hardwaru zaznamenáno jako NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.
Fish-Speech 1.4— Jakou GPU potřebuji k jejímu spuštění?
Nemůžeme říct. Má otevřené váhy, ale žádný počet parametrů pro něj nebyl zveřejněn a každý výpočet paměti a rychlosti začíná od toho čísla. Raději bychom ukázali nic než vykonstruovaný odhad.
Fish-Speech 1.4— Je to OPEN SOURCE?
Jeho váhy jsou zveřejněny, takže si je lze stáhnout a spustit na vlastním hardwaru. Všimněte si, že open WEIGHTS není totéž co open SOURCE v plném smyslu — neříká nic o tréninkových datech, tréninkovém kódu nebo obchodních podmínkách připojených.
Fish-Speech 1.4— kolik má parametrů?
Pro něj nebyl zveřejněn žádný počet parametrů, a proto se na této stránce neobjevují žádné údaje o paměti nebo rychlosti.
Fish-Speech 1.4— Kdo to vytvořil?
Bylo to publikováno společností Fish Audio, zakládající se na United States of America, organizace zařazená jako industry.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.