Trajectory-pooled conv nets
Žádný odhad
Žádné hardwarové požadavky pro tento model
Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..
Na záznamu
Plná specifikace
Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..
Původ
Kdo vytvořil tento model, kde a kdy byl publikován.
- Organizace
- Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences
- Typ organizace
- Academia,Academia
- Země
- Hong Kong, China
- Publikováno
- 19 May 2015
- Autoři
- Limin Wang, Yu Qiao, Xiaoou Tang
Co to dělá
Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.
- Doména
- Video
- Úkol
- Action recognition
- Číselný formát
- FP32
Velikost
Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.
- parametry
- 9.1M
- Výcviková data
- tokens
The input layer takes either a single RGB frame (224x224x3) for the spatial stream or a stack of 10 optical flow frames (224x224x20) for the temporal stream. The first convolutional layer has 96 filters of size 7x7 with stride 2. This is followed by max pooling with size 3x3 and stride 2. The second convolutional layer has 256 filters of size 5x5 with stride 2. After that is another max pooling layer (3x3, stride 2). The third convolutional layer has 512 filters of size 3x3 with stride 1. The fo…
They pretrain on ImageNet, and use UCF101 for actions. Its paper says "We introduce UCF101 which is currently the largest dataset of human actions. It consists of 101 action classes, over 13k clips and 27 hours of video data".
Jak je to klasifikováno
Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.
- Citace
- 3,786
Žrovy
Odkud tento záznam pochází a kdy byl naposledy zkontrolován.
- Reference
- Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors
- Nap poslední aktualizace
- 28 November 2025
Co čísla znamenají
Pozadí
Trajectory-pooled conv nets byl zveřejněn Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences, v zemi zaznamenané jako Hong Kong, během May 2015. Vydavatelská organizace je kategorizována jako academia,Academia.
funguje v oblasti Video, a je zaznamenán jako vykonávající úkol action recognition.
Protože váhy nejsou k dispozici, žádné z hardwarových údajů na tomto webu se na něj nevztahují.
Odpovědi
Trajectory-pooled conv nets — běžné otázky
Trajectory-pooled conv nets— Kdo to vytvořil?
Bylo to publikováno společností Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences, zakládající se na Hong Kong, organizace zařazená jako academia,Academia.
Trajectory-pooled conv nets— Kdy byl vydán?
Bylo to zveřejněno v May 2015. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.
Trajectory-pooled conv nets— K čemu se to používá?
funguje v oblasti Video, a je zaznamenáno jako zpracovávající úkol action recognition. Toto jsou oblasti, kolem nichž byl navržen; popisují záměr spíše než tvrdou hranici.
Trajectory-pooled conv nets— Jakou GPU potřebuji k jejímu spuštění?
Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.
Trajectory-pooled conv nets— Je to OPEN SOURCE?
Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.
Trajectory-pooled conv nets— kolik má parametrů?
Má počet parametrů 9.1M. The input layer takes either a single RGB frame (224x224x3) for the spatial stream or a stack of 10 optical flow frames (224x224x20) for the temporal stream. The first convolutional layer has 96 filters of size 7x7 with stride 2. This is followed by max pooling with size 3x3 and stride 2. The second convolutional layer has 256 filters of size 5x5 with stride 2. After that is another max pooling layer (3x3, stride 2). The third convolutional layer has 512 filters of size 3x3 with stride 1. The fourth convolutional layer has 512 filters of size 3x3 with stride 1. The fifth convolutional layer has 512 filters of size 3x3 with stride 1. Next is a max pooling layer (3x3, stride 2). The fully-connected layers have 4096, 2048, and 101 neurons respectively. (7*7*20+1)*96 + (5*5*20+1)*256 + (3*3*20+1)*512 + (3*3*20+1)*512 + (3*3*20+1)*512 + 2*4096 + (4096+1)*2048 + (2048+1)*101 = 9106245. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.
Druhý směr
Díváte se na to z druhé strany?
Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.