Phrase-based translation

Κλειστές βαρύτητες University of Southern California 9.2M παράμετροι May 2003

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
University of Southern California
Τύπος οργανισμού
Academia
Χώρα
United States of America
Δημοσιευμένο
1 May 2003
Συγγραφείς
Philipp Koehn, Franz Josef Och, Daniel Marcu

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Translation

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
9.2M

There are various components to the system: - Translation probability model phi - The distortion probability distribution d - A langage model p_LM - A length factor w Several translation probability models are considered. The most performant one is the AP word alignment model. The sentence length preferred by the authors is 3 words maximum. In the biggest corpus considered (320k phrase pairs) it produces a phrase translation probability table of 1996k entries. The distortion probability model…

Δεδομένα εκπαίδευσης
20,000,000 tokens

[WORDS] "We used the freely available Europarl corpus to carry out experiments. This corpus contains over 20 million words in each of the eleven official languages of the European Union, covering the proceedings of the European Parliament 1996-2001. 1755 sentences of length 5-15 were reserved for testing." "These results are consistent over training corpus sizes from 10,000 sentence pairs to 320,000 sentence pairs. " So 20 million words or 320k sentence pairs.

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Παραπομπές
4,270

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Statistical Phrase-Based Translation
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Υπόβαθρο

Phrase-based translation δημοσιεύθηκε από University of Southern California, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια May 2003. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του translation.

Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.

Πώς εκπαιδεύτηκε

Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 20,000,000 κωδικοί κειμένου

Απαντήσεις

Phrase-based translation — κοινές ερωτήσεις

01

Phrase-based translation— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε May 2003. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

02

Phrase-based translation— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του translation. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.

03

Phrase-based translation— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

04

Phrase-based translation— είναι ανοιχτού κώδικα;

Η αδειοδότηση δεν καταγράφηκε ποτέ στα πηγά μας δεδομένα. Αντιμετωπίζουμε τις μη δηλωμένες άδειες ως κλειστές, επειδή μια μη καταγεγραμμένη άδεια δεν είναι μία στην οποία μπορείς να βασιστείς.

05

Phrase-based translation— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 9.2M. There are various components to the system: - Translation probability model phi - The distortion probability distribution d - A langage model p_LM - A length factor w Several translation probability models are considered. The most performant one is the AP word alignment model. The sentence length preferred by the authors is 3 words maximum. In the biggest corpus considered (320k phrase pairs) it produces a phrase translation probability table of 1996k entries. The distortion probability model d is taken from (Marcu and Wong, 2002). The distortion probability model must have ~10 parameters at most The language model p_LM is a back off trigram model from (Seymore and Rosenfeld,1997). AFAIK the cutoff used is not specified. Based on the example on section 4.3 of (Seymore and Rosefeld, 1997), a trigram probability model has about 3866964 + 2674322 + 641604 parameters. "For each possible phrase translation anywhere in the sentence (we call it a translation option), we multiply its phrase translation probability with the language model probability for the generated English phrase. As language model probability we use the unigram probability for the first word, the bigram probability for the second, and the trigram probability for all following words" The length factor w is an additional single parameter. "In order to calibrate the output length, we introduce a factor w for each generated English word in addition to the trigram language model " In summary, the parameter count seems to be dominated by the trigram language model and the word alignment phrase translation model. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

06

Phrase-based translation— ποιος το δημιούργησε;

Δημοσιεύθηκε από University of Southern California, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως academia.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.