Universal-2-TF
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- AssemblyAI
- Τύπος οργανισμού
- Industry
- Δημοσιευμένο
- 30 October 2024
- Συγγραφείς
- Core Research Luka Chkhetiani (lead), Andrea Vanzo (lead), Yash Khare, Taufiquzzaman Peyash, Ilya Sklyar Research Contributors Michael Liang, Rami Botros, Ruben Bousbib Research Data Ahmed Etefy Benchmarking Pegah Ghahremani, Gabriel Oexle, Jaime Lorenzo Trueba Research Infrastructure William Pipsico Ferreira Production Engineering Ben Gotthold, Soheyl Bahadoori, Mimi Chiang, Aleksandar Mitov…
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Speech
- Εργασία
- Speech recognition (ASR)
- Βασικό μοντέλο
- Conformer
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 600M
- Δεδομένα εκπαίδευσης
- tokens
1. ASR decoder: "Our models are based on an ASR decoder architecture called the Recurrent Neural Network Transducer (RNN-T), which offers advantages in scalability, robustness against hallucinations, and timestamp accuracy—key factors for real-world usage at scale. We use a 600M parameter Conformer RNN-T model." 2. Text Formatting module.
1. ASR decoder:: "For Universal-2, we doubled the size of the supervised training dataset from 150,000 hours to 300,000 hours." "we first pre-trained an RNN-T encoder using 12.5 million hours of diverse, multilingual audio. After the pre-training, the encoder was combined with a randomly initialized decoder, and the entire model was fine-tuned using a combination of the supervised dataset described above and a pseudo-labeled dataset, similar to the approach used in Universal-1." 2. Text formatt…
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- API access
- Κωδικός εκπαίδευσης
- Unreleased
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Unknown
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Robust All-Neural Text Formatting for ASR
- Τελευταία ενημέρωση
- 28 November 2025
Τι σημαίνουν οι αριθμοί
Υπόβαθρο
Universal-2-TF δημοσιεύθηκε από AssemblyAI, κατά τη διάρκεια October 2024. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry.
Λειτουργεί στον τομέα της Speech, και καταγράφεται ότι εκτελεί την εργασία του speech recognition (ASR).
Αντί να εκπαιδευτεί από την αρχή, προέρχεται από Conformer. Αυτή είναι η συνηθισμένη διαδικασία παραγωγής ενός εξειδικευμένου μοντέλου.
Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.
Απαντήσεις
Universal-2-TF — κοινές ερωτήσεις
Universal-2-TF— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 600M. 1. ASR decoder: "Our models are based on an ASR decoder architecture called the Recurrent Neural Network Transducer (RNN-T), which offers advantages in scalability, robustness against hallucinations, and timestamp accuracy—key factors for real-world usage at scale. We use a 600M parameter Conformer RNN-T model." 2. Text Formatting module. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
Universal-2-TF— ποιος το δημιούργησε;
Δημοσιεύθηκε από AssemblyAI, μία οργάνωση κατηγοριοποιημένη ως industry.
Universal-2-TF— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε October 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Universal-2-TF— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Speech, και καταγράφεται ως διαχείριση της εργασίας του speech recognition (ASR). Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.
Universal-2-TF— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
Universal-2-TF— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.