Fish-Speech 1.4
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Τα βάρη αυτού του μοντέλου είναι OPEN, αλλά κανένας αριθμός παραμέτρων δεν έχει δημοσιευθεί γι' αυτό. Κάθε FIGURE μνήμης και ταχύτητας ξεκινά από αυτόν τον αριθμό, οπότε θα προτιμούσαμε να μην δείξουμε τίποτα παρά μια κατασκευασμένη εκτίμηση..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Fish Audio
- Τύπος οργανισμού
- Industry
- Χώρα
- United States of America
- Δημοσιευμένο
- 9 November 2024
- Συγγραφείς
- Shijia Liao, Yuxuan Wang, Tianyu Li, Yifan Cheng, Ruoyi Zhang, Rongzhi Zhou, Yijin Xing
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Speech
- Εργασία
- Speech synthesis, Text-to-speech (TTS)
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- Δεδομένα εκπαίδευσης
- 500,000,000,000 tokens
[tokens] "The dataset contains about 720,000 hours of speech across different languages, with 300,000 hours each of English and Mandarin Chinese as the main components. We also included 20,000 hours each of other language families: Germanic (German), Romance (French, Italian), East Asian (Japanese, Korean), and Semitic (Arabic)." • Batch size: 1M tokens • Training steps: 500K 10^6 * 500000 = 5*10^11 tokens
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 1.9 × 10²¹ FLOP
- Πώς ιδρύθηκε
- Hardware
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week. Note that these timelines exclude the DPO stage." (989400000000000 FLOP / GPU / sec [H100, bf16 assumed] + 330000000000000 FLOP / GPU / sec [4090, bf16 assumed]) * 8 GPUs * 168 hours * 3600 sec / hour * 0.3 [assumed utilization] = 1.9151355e+21 FLOP
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090
- χρησιμοποιούμενα τσιπ
- 8
- Χρόνος τοίχου
- 168 hours (7 days)
"The AR training utilized an 8*H100 80G GPUs for one week, while the vocoder training employed an 8*4090 GPUs for an additional week" 1 week = 168 hours
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Open — downloadable
- Πρόσβαση μοντέλου
- Open weights (non-commercial)
- Κωδικός εκπαίδευσης
- Open source
- Αγκαλιάζοντας το Πρόσωπο
- fishaudio
This codebase is released under Apache License and all model weights are released under CC-BY-NC-SA-4.0 License https://github.com/fishaudio/fish-speech/tree/main/fish_speech https://huggingface.co/fishaudio/fish-speech-1.4
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Confident
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
- Τελευταία ενημέρωση
- 28 November 2025
Τι σημαίνουν οι αριθμοί
Από πού προήλθε
Fish-Speech 1.4 δημοσιεύθηκε από Fish Audio, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια November 2024. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.
Λειτουργεί στον τομέα της Speech, και καταγράφεται ότι εκτελεί την εργασία του speech synthesis, Text-to-speech (TTS).
Επειδή τα βάρη του απελευθερώθηκαν, τίποτα σχετικά με την εκτέλεσή του δεν εξαρτάται από το να παραμείνει διαθέσιμος ένας προμηθευτής - είναι δικό σας μόλις το κατεβάσετε. Στο Hugging Face δημοσιεύεται υπό την οργάνωση fishaudio.
Τι χρειάστηκε για την κατασκευή του
Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 1.9 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Εκπαιδεύτηκε σε ένα σώμα περίπου 500,000,000,000 κωδικοί κειμένου
Απαντήσεις
Fish-Speech 1.4 — κοινές ερωτήσεις
Fish-Speech 1.4— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε November 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Fish-Speech 1.4— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Speech, και καταγράφεται ως διαχείριση της εργασίας του speech synthesis, Text-to-speech (TTS). Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.
Fish-Speech 1.4— πού μπορώ να το κατεβάσω;
Τα βάρη του είναι δημοσιευμένα στο Hugging Face, υπό την οργάνωση fishaudio. Δεν φιλοξενούμε αρχεία μοντέλων — αυτός ο ιστότοπος υπολογίζει ποιο υλικό απαιτείται για να τα εκτελέσετε.
Fish-Speech 1.4— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 1.9 × 10²¹ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA H100 SXM5 80GB,NVIDIA GeForce RTX 4090. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
Fish-Speech 1.4— ποια GPU χρειάζομαι για να το τρέξω;
Δεν μπορούμε να πούμε. Έχει OPEN WEIGHTS, αλλά δεν έχει δημοσιευτεί καμία μέτρηση παραμέτρων για αυτό, και όλοι οι υπολογισμοί ΜΝΗΜΗΣ και ταχύτητας ξεκινούν από αυτόν τον αριθμό. Θα προτιμούσαμε να μην δείξουμε τίποτα από το να δώσουμε μια κατασκευασμένη εκτίμηση.
Fish-Speech 1.4— είναι ανοιχτού κώδικα;
Οι βάσεις του είναι δημοσιευμένες, οπότε μπορεί να κατέβει και να τρέξει σε δικό σας υλικό. Σημειώστε ότι τα open weights δεν είναι το ίδιο με το open source με την πλήρη έννοια — δεν λέει τίποτα για τα δεδομένα εκπαίδευσης, τον κώδικα εκπαίδευσης ή τους εμπορικούς όρους που συσχετίζονται.
Fish-Speech 1.4— πόσες παραμέτρους έχει;
Δεν έχει δημοσιευθεί αριθμός παραμέτρων γι' αυτό, γι' αυτό και δεν εμφανίζεται καμία τιμή μνήμης ή ταχύτητας σε αυτή τη σελίδα.
Fish-Speech 1.4— ποιος το δημιούργησε;
Δημοσιεύθηκε από Fish Audio, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.