Phrase-based translation

Pesi chiusi University of Southern California 9.2M parametri May 2003

Nessuna stima

Nessun requisito hardware per questo modello

I pesi per questo modello non sono stati pubblicati, quindi non può essere scaricato o eseguito sul proprio hardware di qualsiasi dimensione. È accessibile solo attraverso il suo fornitore e nessun cambiamento della scheda grafica che.

In registrazione

specifiche complete

Tutto in archivio per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come gira — contesto utile per giudicare quanto lavoro c'è stato dietro, e come si confronta con i modelli costruiti su una scala diversa..

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
University of Southern California
Tipo di organizzazione
Academia
Paese
United States of America
Pubblicato
1 May 2003
Autori
Philipp Koehn, Franz Josef Och, Daniel Marcu

Cosa fa

Le aree problematiche per cui è stato progettato il modello. Un modello può contenere diversi di ciascuno.

Dominio
Language
Compito
Translation

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una determinata scheda grafica.

parametri
9.2M

There are various components to the system: - Translation probability model phi - The distortion probability distribution d - A langage model p_LM - A length factor w Several translation probability models are considered. The most performant one is the AP word alignment model. The sentence length preferred by the authors is 3 words maximum. In the biggest corpus considered (320k phrase pairs) it produces a phrase translation probability table of 1996k entries. The distortion probability model…

Dati di addestramento
20,000,000 tokens

[WORDS] "We used the freely available Europarl corpus to carry out experiments. This corpus contains over 20 million words in each of the eleven official languages of the European Union, covering the proceedings of the European Parliament 1996-2001. 1755 sentences of length 5-15 were reserved for testing." "These results are consistent over training corpus sizes from 10,000 sentence pairs to 320,000 sentence pairs. " So 20 million words or 320k sentence pairs.

Come è classificato

Etichette del dataset sorgente si applicano quando si tracciano modelli notevoli, e quanto è sicuro nell'entry.

Citazioni
4,270

Fonti

Da dove proviene questo record e quando è stato controllato l'ultima volta.

Riferimento
Statistical Phrase-Based Translation
Ultimo aggiornamento
28 November 2025

Cosa significano i numeri

Sfondo

Phrase-based translation è stato pubblicato da University of Southern California, nel paese registrato come United States of America, durante May 2003. La categoria sotto cui rientra l'editore è academia.

Funziona nel dominio di Language, ed è registrato come eseguire il compito di translation.

Questo è un modello chiuso: i valori addestrati sono rimasti con chi li ha prodotti, e non c'è una versione locale da eseguire.

Come è stato addestrato

L'addestramento ha consumato un corpus di circa 20,000,000 token di testo

Risposte

Phrase-based translation — domande comuni

01

Phrase-based translation— quando è stato rilasciato?

È stato pubblicato in May 2003. La capacità per parametro è migliorata considerevolmente da allora, quindi un modello più recente della stessa dimensione è spesso un uso migliore dello stesso hardware.

02

Phrase-based translation— A cosa serve?

Funziona nel dominio di Language, e viene registrato come gestire il compito di translation. I modelli portano frequentemente più di uno di ciascuno, e le etichette descrivono lo scopo piuttosto che i limiti di capacità.

03

Phrase-based translation— che GPU ho bisogno per eseguirlo?

Nessuno. Questo è un modello chiuso - i suoi pesi non sono mai stati pubblicati, quindi non può essere scaricato o eseguito sul tuo hardware a qualsiasi prezzo. È accessibile solo attraverso il suo fornitore.

04

Phrase-based translation— è open-source?

La licenza non è mai stata registrata nei nostri dati sorgente. Trattiamo le licenze non dichiarate come chiuse, perché una licenza non registrata non è una su cui fare affidamento.

05

Phrase-based translation— quanti parametri ha?

Ha un numero di parametri di 9.2M. There are various components to the system: - Translation probability model phi - The distortion probability distribution d - A langage model p_LM - A length factor w Several translation probability models are considered. The most performant one is the AP word alignment model. The sentence length preferred by the authors is 3 words maximum. In the biggest corpus considered (320k phrase pairs) it produces a phrase translation probability table of 1996k entries. The distortion probability model d is taken from (Marcu and Wong, 2002). The distortion probability model must have ~10 parameters at most The language model p_LM is a back off trigram model from (Seymore and Rosenfeld,1997). AFAIK the cutoff used is not specified. Based on the example on section 4.3 of (Seymore and Rosefeld, 1997), a trigram probability model has about 3866964 + 2674322 + 641604 parameters. "For each possible phrase translation anywhere in the sentence (we call it a translation option), we multiply its phrase translation probability with the language model probability for the generated English phrase. As language model probability we use the unigram probability for the first word, the bigram probability for the second, and the trigram probability for all following words" The length factor w is an additional single parameter. "In order to calibrate the output length, we introduce a factor w for each generated English word in addition to the trigram language model " In summary, the parameter count seems to be dominated by the trigram language model and the word alignment phrase translation model. Quella cifra è il totale, ed è ciò che decide quanto memoria il modello ha bisogno — circa mezzo gigabyte per miliardo alla compressione che la maggior parte delle persone usa.

06

Phrase-based translation— chi l'ha creato?

È stato pubblicato da University of Southern California, basato su United States of America, un'organizzazione categorizzata come academia.

Fonte

Pubblicazione originale

Ultimo aggiornamento del record 28 November 2025

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina parte dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che farà funzionare, inizia dall'hardware invece.