MV-RNN

Zamknięte wagi Stanford University 3.5M parametry July 2012

Brak oszacowania

Brak wymagań sprzętowych dla tego modelu

Wagi dla tego modelu nie zostały opublikowane, więc nie można ich pobrać ani uruchomić na własnym sprzęcie w żadnym rozmiarze. Jest dostępny tylko za pośrednictwem swojego dostawcy, a zmiana karty graficznej tego nie zmienia..

Na nagranie

Pełna specyfikacja

Wszystko na rekord dla tego modelu. Większość z tego opisuje, jak był trenowany, a nie jak działa — użyteczny kontekst do oceny, ile pracy włożono w to, i jak wypada w porównaniu z modelami budowanymi w innym skali..

Pochodzenie

Kto zbudował ten model, gdzie i kiedy został opublikowany.

Organizacja
Stanford University
Typ organizacji
Academia
Kraj
United States of America
Opublikowany
12 July 2012
Autorzy
R. Socher, B. Huval, C. D. Manning, and A. Y. Ng

Co to robi

Obszary problemowe, dla których stworzono model. Model może mieć kilka z każdego.

Domena
Language
Zadanie
Text classification

Rozmiar

Jak duży jest model i na ile danych był trenowany. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.

parametry
3.5M

"We represent a word as both a continuous vector and a matrix of parameters. We initialize all word vectors x ∈ Rn with pre-trained 50-dimensional word vectors from the unsupervised model of Collobert and Weston (2008). [...] Every word is also associated with a matrix X. [...] If the vectors have dimensionality n, then each word’s matrix has dimensionality X ∈ Rn×n." "We propose the following combination function which is input dependent: p = fA,B(a, b) = f(Ba, Ab) = g(W x (Ba Ab)) ,(2) where…

Dane treningowe
10,000 tokens

Jak jest klasyfikowane

Etykiety, które źródłowy zbiór danych stosuje podczas śledzenia znaczących modeli oraz jak pewny jest tego wpisu.

Cytaty
1,459

Źródła

Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.

Referencja
Semantic Compositionality through Recursive Matrix-Vector Spaces
Ostatnio zaktualizowane
28 November 2025

Co oznaczają liczby

Tło

MV-RNN został opublikowany przez Stanford University, w kraju zapisanym jako United States of America, podczas July 2012. Kategoria, do której należy wydawca, to academia.

Działa w dziedzinie Language, i jest zapisany jako wykonujący zadanie text classification.

Ponieważ wagi nie są dostępne, żadne z danych dotyczących sprzętu gdzie indziej na tej stronie się do niego nie odnoszą.

Szkolenie i pochodzenie

Został wytrenowany na korpusie około 10,000 Tokeny tekstu.

Odpowiedzi

MV-RNN — częste pytania

01

MV-RNN— kto to stworzył?

Zostało opublikowane przez Stanford University, oparty na United States of America, organizacja sklasyfikowana jako academia.

02

MV-RNN— kiedy to zostało wydane?

Zostało opublikowane w July 2012. Możliwość na parametr znacznie się poprawiła, więc nowszy model tej samej wielkości często lepiej wykorzystuje ten sam sprzęt.

03

MV-RNN— do czego to służy?

Działa w dziedzinie Language, i jest zarejestrowany jako realizujący zadanie text classification. To są obszary, wokół których został zaprojektowany; opisują zamiar, a nie twardą granicę.

04

MV-RNN— Jaką GPU potrzebuję, aby ją uruchomić?

Żaden. To jest zamknięty model — jego wagi nigdy nie zostały opublikowane, więc nie można go pobrać ani uruchomić na własnym sprzęcie za żadną cenę. Jest dostępny tylko przez jego dostawcę.

05

MV-RNN— czy jest open weight?

Licencja nigdy nie została zarejestrowana w naszych danych źródłowych. Traktujemy niewskazaną licencję jako zamkniętą, ponieważ niezarejestrowana licencja nie jest na którą można polegać.

06

MV-RNN— ile ma parametrów?

Ma liczbę parametrów równą 3.5M. "We represent a word as both a continuous vector and a matrix of parameters. We initialize all word vectors x ∈ Rn with pre-trained 50-dimensional word vectors from the unsupervised model of Collobert and Weston (2008). [...] Every word is also associated with a matrix X. [...] If the vectors have dimensionality n, then each word’s matrix has dimensionality X ∈ Rn×n." "We propose the following combination function which is input dependent: p = fA,B(a, b) = f(Ba, Ab) = g(W x (Ba Ab)) ,(2) where A, B are matrices for single words, the global W ∈ Rn×2n is a matrix that maps both transformed words back into the same n-dimensional space." "For computing nonterminal phrase matrices, we define the function P = fM(A, B) = WMA, B, (3) where WM ∈ Rn×2n, so P ∈ Rn×n just like each input matrix." "If every word is represented by an n-dimensional vector and additionally by an n × n matrix, the dimensionality of the whole model may become too large with commonly used vector sizes of n = 100. In order to reduce the number of parameters, we represent word matrices by the following low-rank plus diagonal approximation: A = UV + diag(a), (5) where U ∈ Rn×r, V ∈ Rr×n, a ∈ Rnand we set the rank for all experiments to r = 3." "We train these representations by adding on top of each parent node a simple softmax classifier to predict a class distribution over, e.g., sentiment or relationship classes: d(p) = softmax(Wlabelp). If there are K labels, then d ∈ RK is a K-dimensional multinomial distribution" In total there are V*(n+n*r + r*n) + n*2n + n*2n + (n+1)*k parameters, where n is the vector dimension, r is the low-rank decomposition dimension, V is the vocabulary size and k is the number of classes. In the experiments we have that n=50, r=3, k=? and V=?. I'm guesstimating k=5 and V=10k. Ta liczba to całkowita, i to ona decyduje o tym, ile pamięci potrzebuje model — mniej więcej pół gigabajta na miliard przy kompresji, którą używa większość ludzi.

Źródło

Oryginalna publikacja

Ostatnia aktualizacja rekordu 28 November 2025

Druga strona

Patrząc na to z drugiej strony?

Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, co wszystko będzie działać., Zacznij od sprzętu zamiast.