Fragment embedding

Uzavřené váhy Stanford University 144.5M parametry June 2014

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
Stanford University
Typ organizace
Academia
Země
United States of America
Publikováno
21 June 2014
Autoři
A. Karpathy, Armand Joulin, Li Fei-Fei

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Vision
Úkol
Entity embedding, Semantic segmentation

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
144.5M

Model contains a word embedding. a matrix combining two word embeddings, and image embedding (built upon a pretrained RCNN image model. Word embedding: 400000 * 200 =80000000 ("Here, We is a d × 400, 000 matrix that encodes a 1-of-k vector into a d-dimensional word vector representation (we use d = 200)." Embedding dimension: 1000 ("The size of the embedded space is cross-validated, and we found that values of approximately 1000 generally work well." Word combination matrix: 400* 1000=400000 Ima…

Výcviková data
15,000,000 tokens

Largest experiment uses 30000 training images, 30000 * 5 = 150,000 sentences

Epochy
20

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
SOTA improvement

"Extensive experimental evaluation shows that reasoning on both the global level of images and sentences and the finer level of their respective fragments significantly improves performance on image-sentence retrieval tasks."

Záznam důvěry
Likely

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
Deep Fragment Embeddings for Bidirectional Image Sentence Mapping
Nap poslední aktualizace
28 November 2025

Co čísla znamenají

Odkud to přišlo

Fragment embedding byl zveřejněn Stanford University, v zemi zaznamenané jako United States of America, během June 2014. Vychází z organizace, která je kategorizována jako academia.

funguje v oblasti Vision, a je zaznamenán jako vykonávající úkol entity embedding, Semantic segmentation.

Protože váhy nejsou k dispozici, žádné z hardwarových údajů na tomto webu se na něj nevztahují.

Co bylo zapotřebí k jeho vybudování

Tréninková sada běžela na přibližně 15,000,000 tokeny textu

Je sledováno v základním datasetu z jednoho konkrétního důvodu: sOTA improvement.

Odpovědi

Fragment embedding — běžné otázky

01

Fragment embedding— kolik má parametrů?

Má počet parametrů 144.5M. Model contains a word embedding. a matrix combining two word embeddings, and image embedding (built upon a pretrained RCNN image model. Word embedding: 400000 * 200 =80000000 ("Here, We is a d × 400, 000 matrix that encodes a 1-of-k vector into a d-dimensional word vector representation (we use d = 200)." Embedding dimension: 1000 ("The size of the embedded space is cross-validated, and we found that values of approximately 1000 generally work well." Word combination matrix: 400* 1000=400000 Image embedding: 4096*1000=4096000 ("We use the Caffe [41] implementation of the ImageNet Detection RCNN model [27] to detect objects in all images. On our machine with a Tesla K40 GPU, the RCNN processes one image in approximately 25 seconds. We discard the predictions for 200 ImageNet detection classes and only keep the 4096-D activations") CNN: 60,000,000 "The CNN architecture is identical to the one described in Girhsick et al. [26]. It contains approximately 60 million parameters" Total parameters: 4096000+80000000+400000+60000000=144,496,000. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

02

Fragment embedding— Kdo to vytvořil?

Bylo to publikováno společností Stanford University, zakládající se na United States of America, organizace zařazená jako academia.

03

Fragment embedding— Kdy byl vydán?

Bylo to zveřejněno v June 2014. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

04

Fragment embedding— K čemu se to používá?

funguje v oblasti Vision, a je zaznamenáno jako zpracovávající úkol entity embedding, Semantic segmentation. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.

05

Fragment embedding— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

06

Fragment embedding— Je to OPEN SOURCE?

Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 28 November 2025

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.