Fish-Speech 1.5

Apri i pesi Fish Audio November 2024

Nessuna stima

Nessun requisito hardware per questo modello

I pesi di questo modello sono open weight, ma non è stato pubblicato alcun conteggio dei parametri. Ogni figura di memory e velocità parte da quel numero, quindi preferiremmo non mostrare nulla piuttosto che una stima fabbricata..

In registrazione

specifiche complete

Tutto in archivio per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come gira — contesto utile per giudicare quanto lavoro c'è stato dietro, e come si confronta con i modelli costruiti su una scala diversa..

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
Fish Audio
Tipo di organizzazione
Industry
Paese
United States of America
Pubblicato
24 November 2024

Cosa fa

Le aree problematiche per cui è stato progettato il modello. Un modello può contenere diversi di ciascuno.

Dominio
Speech
Compito
Speech synthesis, Text-to-speech (TTS)

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una determinata scheda grafica.

Dati di addestramento
700,000,000,000 tokens

[tokens] Their previous model was trained on 720000 hours of audio data that was equal to 5*10^11 tokens -> 1M hours ~ 7*10^11 tokens model trained on more than 1 million hours of audio data in multiple languages.

Calcolo di addestramento

L'aritmetica eseguita per addestrare il modello, misurata in operazioni in virgola mobile. È una misura di quanto è costato il run di addestramento, e non di quanto velocemente il modello finito ti risponde.

Calcolo di addestramento
2.7 × 10²¹ FLOP

Previous model Fish-Speech 1.4 used 1.9151355e+21 FLOP for training (see model card) and was trained on 720000 hours of audio, while this model is similar but trained on 1M hours of audio -> its training compute couldbe estimated as 1.9151355e+21 * 10^6 / 720000 = 2.6599104e+21 FLOP

Come è stato stabilito
Comparison with other models

Disponibilità

Se puoi ottenere il modello e farlo funzionare sul tuo hardware, il che decide se alcune delle cifre della scheda grafica su questa pagina sono applicabili.

Pesi
Open — downloadable
Accesso al modello
Open weights (non-commercial)
Codice di addestramento
Open source

weights are released under CC-BY-NC-SA-4.0 License https://huggingface.co/fishaudio/fish-speech-1.5 This codebase is released under Apache License https://github.com/fishaudio/fish-speech/tree/main/fish_speech

Hugging Face
fishaudio

Come è classificato

Etichette del dataset sorgente si applicano quando si tracciano modelli notevoli, e quanto è sicuro nell'entry.

Record fiducia
Likely

Fonti

Da dove proviene questo record e quando è stato controllato l'ultima volta.

Riferimento
Fish Speech V1.5 is a leading text-to-speech (TTS) model trained on more than 1 million hours of audio data in multiple languages.
Ultimo aggiornamento
28 November 2025

Cosa significano i numeri

Da dove è venuto

Fish-Speech 1.5 è stato pubblicato da Fish Audio, nel paese registrato come United States of America, durante November 2024. La categoria sotto cui rientra l'editore è industry.

Funziona nel dominio di Speech, ed è registrato come eseguire il compito di speech synthesis, Text-to-speech (TTS).

I pesi sono pubblicati, quindi possono essere scaricati e eseguiti sul proprio hardware indefinitamente, offline, senza un account associato. Su Hugging Face è pubblicato sotto l'organizzazione fishaudio.

Come è stato addestrato

La produzione di esso ha richiesto un'aritmetica totale di circa 2.7 × 10²¹ FLOP. Quella cifra misura quanto è costata la produzione del modello e non ha alcun impatto su quanto velocemente risponde.

L'addestramento ha consumato un corpus di circa 700,000,000,000 token di testo

Risposte

Fish-Speech 1.5 — domande comuni

01

Fish-Speech 1.5— quanto calcolo è stato utilizzato per addestrarlo?

L'addestramento ha consumato circa 2.7 × 10²¹ FLOP. Questo misura quanto costa produrre il modello e non dice nulla su quanto rapidamente risponde una volta addestrato — la velocità di inferenza deriva dalla larghezza di banda della memoria, non dal budget di addestramento.

02

Fish-Speech 1.5— che GPU ho bisogno per eseguirlo?

Non possiamo dire. Ha pesi aperti, ma non è stato pubblicato alcun conteggio dei parametri per esso, e ogni calcolo di memoria e velocità parte da quel numero. Preferiremmo non mostrare nulla piuttosto che una stima fabbricata.

03

Fish-Speech 1.5— è open-source?

I suoi pesi sono pubblicati, quindi può essere scaricato e eseguito sul proprio hardware. Si noti che OPEN WEIGHTS non è lo stesso di OPEN SOURCE nel senso completo — non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali allegati.

04

Fish-Speech 1.5— quanti parametri ha?

Non è stato pubblicato alcun conteggio dei parametri per esso, motivo per cui non appare alcun dato sulla memoria o sulla velocità su questa pagina.

05

Fish-Speech 1.5— chi l'ha creato?

È stato pubblicato da Fish Audio, basato su United States of America, un'organizzazione categorizzata come industry.

06

Fish-Speech 1.5— quando è stato rilasciato?

È stato pubblicato in November 2024. La capacità per parametro è migliorata considerevolmente da allora, quindi un modello più recente della stessa dimensione è spesso un uso migliore dello stesso hardware.

07

Fish-Speech 1.5— A cosa serve?

Funziona nel dominio di Speech, e viene registrato come gestire il compito di speech synthesis, Text-to-speech (TTS). Queste sono le aree su cui è stato progettato; descrivono l'intento piuttosto che un confine rigido.

08

Fish-Speech 1.5— Dove posso scaricarlo?

I suoi pesi sono pubblicati su Hugging Face, sotto l'organizzazione fishaudio. Non ospitiamo file di modelli — questo sito calcola quale hardware è necessario per eseguirli.

Fonte

Pubblicazione originale

Ultimo aggiornamento del record 28 November 2025

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina parte dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che farà funzionare, inizia dall'hardware invece.