RNN 1000/5 + RT09 LM (NIST RT05)

Geschlossene Gewichtungen Brno University of Technology,Johns Hopkins University 77M Parameter September 2010

Keine Schätzung

Keine Hardwareanforderungen für dieses Modell

Die Gewichte für dieses Modell wurden nicht veröffentlicht, daher kann es nicht heruntergeladen oder auf Ihrer eigenen Hardware in beliebiger Größe betrieben werden. Es ist nur über seinen Anbieter erreichbar, und keine Grafikkarte ändert das..

Aufgezeichnet

Volle Spezifikation

Alles, was in unserer Datenbank für dieses Modell aufgezeichnet ist. Der Großteil beschreibt, wie es trainiert wurde, anstatt wie es läuft — nützlicher Kontext zur Beurteilung, wie viel Arbeit darin steckt und wie es sich mit Modellen vergleicht, die in einem anderen Maßstab erstellt wurden..

Ursprung

Wer hat dieses Modell gebaut, wo und wann es veröffentlicht wurde.

Organisation
Brno University of Technology,Johns Hopkins University
Organisationsart
Academia,Academia
Land
Czechia, United States of America
Veröffentlicht
26 September 2010
Autoren
T. Mikolov, M. Karafiat, L. Burget, J. Cernocky, and S. Khudanpur

Was es tut

Die Problemfelder, für die das Modell entwickelt wurde. Ein Modell kann mehrere davon tragen.

Domain
Speech
Aufgabe
Speech recognition (ASR), Transcription
Ansatz
Supervised

Größe

Wie groß das Modell ist und wie viele Daten damit trainiert wurden. Parameter sind die Zahl, die entscheidet, ob es auf einer bestimmten GPU-Karte passt.

Parameter
77M

"The acoustic HMMs are based on cross-word tied-states triphones trained discriminatively using MPE criteria. Feature extraction use 13 Mel-PLP’s features with deltas, double and triple deltas reduced by HLDA to 39-dimension feature vector" RNN 1000/5 indicates that the model has a 1000 units in the hidden layer and merges words that occur less than 5 times in the training set. Section 4.2 in this paper appears to indicate that NIST RT05 has a vocabulary of 50k words: https://www.fit.vut.cz/pe…

Trainingsdaten
5,400,000 tokens

"Table 4: Comparison of very large back-off LMs and RNN LMs trained only on limited in-domain data (5.4M words)."

Epochen
20

Training-Compute

Die Berechnung, die durchgeführt wird, um das Modell zu trainieren, gemessen in Gleitpunktoperationen. Es ist ein Maß dafür, was der Trainingslauf gekostet hat, nicht dafür, wie schnell das fertige Modell Ihnen antwortet.

Training-Compute
5 × 10¹⁶ FLOP

"Convergence is usually achieved after 10-20 epochs." Assuming a backward-forward ratio of 2:1, since this is a shallow network 6 * 77039000 * 5.4M * 20 = 5.00e16

Wie es etabliert wurde
Operation counting

Der Trainingslauf

Was es physisch gekostet hat, um zu trainieren: welche Chips, wie viele, wie lange und was das aus der Wand gezogen hat.

Wand-Uhrzeit
1,200 hours (50 days)

The biggest individual models evaluated on WSJ (probably RNN 250/2 at 27M parameters) took about 2.1e16 FLOPs to train, and training took "several weeks". Assuming a linear scaleup and several = about 3: 3 weeks * 7 days/week * 24 hr/day * 5e16/2.1e16 = 1,200 hours

Verfügbarkeit

Ob Sie das Modell beziehen und es auf Ihrer eigenen Hardware ausführen können, bestimmt, ob eine der Grafikkarten-Zahlen auf dieser Seite zutrifft.

Gewichte
Closed — provider access only
Modellzugang
Unreleased

Wie es klassifiziert ist

Labels, die das Quell-Datenset anwendet, wenn bemerkenswerte Modelle verfolgt werden, und wie zuversichtlich es in den Eintrag ist.

Grenzmodell
Yes
Warum es verfolgt wird
Highly cited
Aufzeichnungsgenauigkeit
Likely
Zitationen
6,038

Quellen

Woher dieser Datensatz stammt und wann er zuletzt überprüft wurde.

Referenz
Recurrent neural network based language model
Zuletzt aktualisiert
11 February 2026

Was die Zahlen bedeuten

Hintergrund

RNN 1000/5 + RT09 LM (NIST RT05) wurde veröffentlicht von Brno University of Technology,Johns Hopkins University, im Land aufgezeichnet als Czechia, während September 2010. Die Kategorie, in die der Herausgeber fällt, ist academia,Academia.

Es funktioniert im Bereich von Speech, und wird als die Aufgabe von aufgezeichnet speech recognition (ASR), Transcription.

Da die Gewichte nicht verfügbar sind, gelten keine der Hardwareangaben an anderer Stelle auf dieser Seite für sie.

Training und Herkunft

Die Herstellung erforderte eine Arithmetik, die insgesamt etwa 5 × 10¹⁶ FLOP. Diese Zahl misst die Kosten für die Produktion des MODELLS und hat keinen Einfluss darauf, wie schnell es antwortet.

Training verbrauchte ein Korpus von etwa 5,400,000 Text-Tokens

Das Einschlusskriterium: highly cited.

Antworten

RNN 1000/5 + RT09 LM (NIST RT05) — Häufige Fragen

01

RNN 1000/5 + RT09 LM (NIST RT05)— Welche GPU benötige ich, um es auszuführen?

Dieses ist ein geschlossenes Modell — seine Gewichte wurden nie veröffentlicht, sodass es zu keinem Preis heruntergeladen oder auf Ihrer eigenen Hardware ausgeführt werden kann. Es ist nur über seinen Anbieter erreichbar.

02

RNN 1000/5 + RT09 LM (NIST RT05)— Ist es Open-Source?

Nein. Seine Gewichte wurden nicht veröffentlicht, daher existiert es nur als ein Dienst, der von seinem Eigentümer kontrolliert wird.

03

RNN 1000/5 + RT09 LM (NIST RT05)— Wie viele Parameter hat es?

Es hat eine Parameteranzahl von 77M. "The acoustic HMMs are based on cross-word tied-states triphones trained discriminatively using MPE criteria. Feature extraction use 13 Mel-PLP’s features with deltas, double and triple deltas reduced by HLDA to 39-dimension feature vector" RNN 1000/5 indicates that the model has a 1000 units in the hidden layer and merges words that occur less than 5 times in the training set. Section 4.2 in this paper appears to indicate that NIST RT05 has a vocabulary of 50k words: https://www.fit.vut.cz/person/imikolov/public/rnnlm/char.pdf Using this dataset of english word frequencies ... https://www.kaggle.com/datasets/rtatman/english-word-frequency ... we can estimate that the number of words in the final vocabulary would have been around 38k when merging with threshold 5: https://colab.research.google.com/drive/1K5qH0EqXtFwTLESNtp4oelCM28GpGXt6?usp=sharing Thus the model in question would have: (39 + 1000 + 38k) * 1000 + 1000 * 38k = 77,039,000 parameters The RT09 LM they interpolate with appears to be a 4-gram model. In one sense, n-gram models have parameters roughly equal to the number of unique n-grams in the training data. However, these aren't parameters in the same sense as neural networks as they are accessed as a lookup table, so on each forward pass only one parameter is active. I choose not to include these parameters in our count. Diese Zahl ist die Gesamtsumme, und sie bestimmt, wie viel MEMORY das MODEL benötigt – ungefähr ein halbes Gigabyte pro Milliarde bei der Kompression, die die meisten Menschen verwenden.

04

RNN 1000/5 + RT09 LM (NIST RT05)— Wer hat es erstellt?

Es wurde veröffentlicht von Brno University of Technology,Johns Hopkins University, basiert auf Czechia, eine als kategorisierte Organisation academia,Academia.

05

RNN 1000/5 + RT09 LM (NIST RT05)— Wann wurde es veröffentlicht?

Es wurde veröffentlicht in September 2010. Die Fähigkeit pro Parameter hat sich erheblich verbessert, sodass ein neueres Modell derselben Größe oft die bessere Nutzung derselben Hardware darstellt.

06

RNN 1000/5 + RT09 LM (NIST RT05)— Wofür wird es verwendet?

Es funktioniert im Bereich von Speech, und wird als Bewältigung der Aufgabe von speech recognition (ASR), Transcription. Dies sind die Bereiche, um die es entworfen wurde; sie beschreiben die Absicht und nicht eine harte Grenze.

07

RNN 1000/5 + RT09 LM (NIST RT05)— Wie viel Rechenleistung wurde verwendet, um es zu trainieren?

Training verbrauchte etwa 5 × 10¹⁶ FLOP. Das misst, was die Produktion des Modells gekostet hat, und sagt nichts darüber aus, wie schnell es einmal trainiert antwortet — die Inferenzgeschwindigkeit kommt von der MEMORY-BANDWIDTH, nicht vom TRAINING-BUDGET.

Quelle

Originalveröffentlichung

Letzte Aktualisierung des Protokolls 11 February 2026

Die andere Richtung

Von der anderen Seite aus betrachten?

Diese Seite beginnt mit dem Modell. Wenn Sie bereits eine Karte besitzen und alles wissen möchten, was sie ausführen wird, Starte stattdessen von der Hardware.