Fish-Speech 1.4

Ανοιχτά βάρη Fish Audio November 2024

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Τα βάρη αυτού του μοντέλου είναι OPEN, αλλά κανένας αριθμός παραμέτρων δεν έχει δημοσιευθεί γι' αυτό. Κάθε FIGURE μνήμης και ταχύτητας ξεκινά από αυτόν τον αριθμό, οπότε θα προτιμούσαμε να μην δείξουμε τίποτα παρά μια κατασκευασμένη εκτίμηση..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Fish Audio
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
9 November 2024
Συγγραφείς
Shijia Liao, Yuxuan Wang, Tianyu Li, Yifan Cheng, Ruoyi Zhang, Rongzhi Zhou, Yijin Xing

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Speech
Εργασία
Speech synthesis, Text-to-speech (TTS)

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

Δεδομένα εκπαίδευσης
500,000,000,000 tokens

[tokens] "The dataset contains about 720,000 hours of speech across different languages, with 300,000 hours each of English and Mandarin Chinese as the main components. We also included 20,000 hours each of other language families: Germanic (German), Romance (French, Italian), East Asian (Japanese, Korean), and Semitic (Arabic)." • Batch size: 1M tokens • Training steps: 500K 10^6 * 500000 = 5*10^11 tokens

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
1.9 × 10²¹ FLOP

"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week. Note that these timelines exclude the DPO stage." (989400000000000 FLOP / GPU / sec [H100, bf16 assumed] + 330000000000000 FLOP / GPU / sec [4090, bf16 assumed]) * 8 GPUs * 168 hours * 3600 sec / hour * 0.3 [assumed utilization] = 1.9151355e+21 FLOP

Πώς ιδρύθηκε
Hardware

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090
χρησιμοποιούμενα τσιπ
8
Χρόνος τοίχου
168 hours (7 days)

"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week" 1 week = 168 hours

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Open — downloadable
Πρόσβαση μοντέλου
Open weights (non-commercial)
Κωδικός εκπαίδευσης
Open source

This codebase is released under Apache License and all model weights are released under CC-BY-NC-SA-4.0 License https://github.com/fishaudio/fish-speech/tree/main/fish_speech https://huggingface.co/fishaudio/fish-speech-1.4

Αγκαλιάζοντας το Πρόσωπο
fishaudio

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Confident

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

Fish-Speech 1.4 δημοσιεύθηκε από Fish Audio, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια November 2024. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.

Λειτουργεί στον τομέα της Speech, και καταγράφεται ότι εκτελεί την εργασία του speech synthesis, Text-to-speech (TTS).

Επειδή τα βάρη του απελευθερώθηκαν, τίποτα σχετικά με την εκτέλεσή του δεν εξαρτάται από το να παραμείνει διαθέσιμος ένας προμηθευτής - είναι δικό σας μόλις το κατεβάσετε. Στο Hugging Face δημοσιεύεται υπό την οργάνωση fishaudio.

Τι χρειάστηκε για την κατασκευή του

Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 1.9 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Εκπαιδεύτηκε σε ένα σώμα περίπου 500,000,000,000 κωδικοί κειμένου

Απαντήσεις

Fish-Speech 1.4 — κοινές ερωτήσεις

01

Fish-Speech 1.4— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε November 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

02

Fish-Speech 1.4— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Speech, και καταγράφεται ως διαχείριση της εργασίας του speech synthesis, Text-to-speech (TTS). Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

03

Fish-Speech 1.4— πού μπορώ να το κατεβάσω;

Τα βάρη του είναι δημοσιευμένα στο Hugging Face, υπό την οργάνωση fishaudio. Δεν φιλοξενούμε αρχεία μοντέλων — αυτός ο ιστότοπος υπολογίζει ποιο υλικό απαιτείται για να τα εκτελέσετε.

04

Fish-Speech 1.4— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 1.9 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

05

Fish-Speech 1.4— ποια GPU χρειάζομαι για να το τρέξω;

Δεν μπορούμε να πούμε. Έχει OPEN WEIGHTS, αλλά δεν έχει δημοσιευτεί καμία μέτρηση παραμέτρων για αυτό, και όλοι οι υπολογισμοί ΜΝΗΜΗΣ και ταχύτητας ξεκινούν από αυτόν τον αριθμό. Θα προτιμούσαμε να μην δείξουμε τίποτα από το να δώσουμε μια κατασκευασμένη εκτίμηση.

06

Fish-Speech 1.4— είναι ανοιχτού κώδικα;

Οι βάσεις του είναι δημοσιευμένες, οπότε μπορεί να κατέβει και να τρέξει σε δικό σας υλικό. Σημειώστε ότι τα open weights δεν είναι το ίδιο με το open source με την πλήρη έννοια — δεν λέει τίποτα για τα δεδομένα εκπαίδευσης, τον κώδικα εκπαίδευσης ή τους εμπορικούς όρους που συσχετίζονται.

07

Fish-Speech 1.4— πόσες παραμέτρους έχει;

Δεν έχει δημοσιευθεί αριθμός παραμέτρων γι' αυτό, γι' αυτό και δεν εμφανίζεται καμία τιμή μνήμης ή ταχύτητας σε αυτή τη σελίδα.

08

Fish-Speech 1.4— ποιος το δημιούργησε;

Δημοσιεύθηκε από Fish Audio, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.