Fragment embedding

Geschlossene Gewichtungen Stanford University 144.5M Parameter June 2014

Keine Schätzung

Keine Hardwareanforderungen für dieses Modell

Die Gewichte für dieses Modell wurden nicht veröffentlicht, daher kann es nicht heruntergeladen oder auf Ihrer eigenen Hardware in beliebiger Größe betrieben werden. Es ist nur über seinen Anbieter erreichbar, und keine Grafikkarte ändert das..

Aufgezeichnet

Volle Spezifikation

Alles, was in unserer Datenbank für dieses Modell aufgezeichnet ist. Der Großteil beschreibt, wie es trainiert wurde, anstatt wie es läuft — nützlicher Kontext zur Beurteilung, wie viel Arbeit darin steckt und wie es sich mit Modellen vergleicht, die in einem anderen Maßstab erstellt wurden..

Ursprung

Wer hat dieses Modell gebaut, wo und wann es veröffentlicht wurde.

Organisation
Stanford University
Organisationsart
Academia
Land
United States of America
Veröffentlicht
21 June 2014
Autoren
A. Karpathy, Armand Joulin, Li Fei-Fei

Was es tut

Die Problemfelder, für die das Modell entwickelt wurde. Ein Modell kann mehrere davon tragen.

Domain
Vision
Aufgabe
Entity embedding, Semantic segmentation

Größe

Wie groß das Modell ist und wie viele Daten damit trainiert wurden. Parameter sind die Zahl, die entscheidet, ob es auf einer bestimmten GPU-Karte passt.

Parameter
144.5M

Model contains a word embedding. a matrix combining two word embeddings, and image embedding (built upon a pretrained RCNN image model. Word embedding: 400000 * 200 =80000000 ("Here, We is a d × 400, 000 matrix that encodes a 1-of-k vector into a d-dimensional word vector representation (we use d = 200)." Embedding dimension: 1000 ("The size of the embedded space is cross-validated, and we found that values of approximately 1000 generally work well." Word combination matrix: 400* 1000=400000 Ima…

Trainingsdaten
15,000,000 tokens

Largest experiment uses 30000 training images, 30000 * 5 = 150,000 sentences

Epochen
20

Wie es klassifiziert ist

Labels, die das Quell-Datenset anwendet, wenn bemerkenswerte Modelle verfolgt werden, und wie zuversichtlich es in den Eintrag ist.

Warum es verfolgt wird
SOTA improvement

"Extensive experimental evaluation shows that reasoning on both the global level of images and sentences and the finer level of their respective fragments significantly improves performance on image-sentence retrieval tasks."

Aufzeichnungsgenauigkeit
Likely

Quellen

Woher dieser Datensatz stammt und wann er zuletzt überprüft wurde.

Referenz
Deep Fragment Embeddings for Bidirectional Image Sentence Mapping
Zuletzt aktualisiert
28 November 2025

Was die Zahlen bedeuten

Woher es kam

Fragment embedding wurde veröffentlicht von Stanford University, im Land aufgezeichnet als United States of America, während June 2014. Es stammt aus einer Organisation, die kategorisiert ist als academia.

Es funktioniert im Bereich von Vision, und wird als die Aufgabe von aufgezeichnet entity embedding, Semantic segmentation.

Da die Gewichte nicht verfügbar sind, gelten keine der Hardwareangaben an anderer Stelle auf dieser Seite für sie.

Was in den Aufbau geflossen ist

Der Trainingssatz lief auf etwa 15,000,000 Text-Tokens

Es wird aus einem bestimmten Grund im zugrunde liegenden Datensatz verfolgt: sOTA improvement.

Antworten

Fragment embedding — Häufige Fragen

01

Fragment embedding— Wie viele Parameter hat es?

Es hat eine Parameteranzahl von 144.5M. Model contains a word embedding. a matrix combining two word embeddings, and image embedding (built upon a pretrained RCNN image model. Word embedding: 400000 * 200 =80000000 ("Here, We is a d × 400, 000 matrix that encodes a 1-of-k vector into a d-dimensional word vector representation (we use d = 200)." Embedding dimension: 1000 ("The size of the embedded space is cross-validated, and we found that values of approximately 1000 generally work well." Word combination matrix: 400* 1000=400000 Image embedding: 4096*1000=4096000 ("We use the Caffe [41] implementation of the ImageNet Detection RCNN model [27] to detect objects in all images. On our machine with a Tesla K40 GPU, the RCNN processes one image in approximately 25 seconds. We discard the predictions for 200 ImageNet detection classes and only keep the 4096-D activations") CNN: 60,000,000 "The CNN architecture is identical to the one described in Girhsick et al. [26]. It contains approximately 60 million parameters" Total parameters: 4096000+80000000+400000+60000000=144,496,000. Diese Zahl ist die Gesamtsumme, und sie bestimmt, wie viel MEMORY das MODEL benötigt – ungefähr ein halbes Gigabyte pro Milliarde bei der Kompression, die die meisten Menschen verwenden.

02

Fragment embedding— Wer hat es erstellt?

Es wurde veröffentlicht von Stanford University, basiert auf United States of America, eine als kategorisierte Organisation academia.

03

Fragment embedding— Wann wurde es veröffentlicht?

Es wurde veröffentlicht in June 2014. Die Fähigkeit pro Parameter hat sich erheblich verbessert, sodass ein neueres Modell derselben Größe oft die bessere Nutzung derselben Hardware darstellt.

04

Fragment embedding— Wofür wird es verwendet?

Es funktioniert im Bereich von Vision, und wird als Bewältigung der Aufgabe von entity embedding, Semantic segmentation. Ein Modell kann mehrere von jedem tragen, daher sind dies die Bereiche, für die es gebaut wurde, anstatt eine Begrenzung dafür, was es versuchen wird.

05

Fragment embedding— Welche GPU benötige ich, um es auszuführen?

Dieses ist ein geschlossenes Modell — seine Gewichte wurden nie veröffentlicht, sodass es zu keinem Preis heruntergeladen oder auf Ihrer eigenen Hardware ausgeführt werden kann. Es ist nur über seinen Anbieter erreichbar.

06

Fragment embedding— Ist es Open-Source?

Die Lizenzierung wurde nie in unseren Quelldaten aufgezeichnet. Wir behandeln nicht angegebene Lizenzen als geschlossen, da eine nicht aufgezeichnete Lizenz keine ist, auf die man sich verlassen kann.

Quelle

Originalveröffentlichung

Letzte Aktualisierung des Protokolls 28 November 2025

Die andere Richtung

Von der anderen Seite aus betrachten?

Diese Seite beginnt mit dem Modell. Wenn Sie bereits eine Karte besitzen und alles wissen möchten, was sie ausführen wird, Starte stattdessen von der Hardware.