Trajectory-pooled conv nets

Uzavřené váhy Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences 9.1M parametry May 2015

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences
Typ organizace
Academia,Academia
Země
Hong Kong, China
Publikováno
19 May 2015
Autoři
Limin Wang, Yu Qiao, Xiaoou Tang

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Video
Úkol
Action recognition
Číselný formát
FP32

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
9.1M

The input layer takes either a single RGB frame (224x224x3) for the spatial stream or a stack of 10 optical flow frames (224x224x20) for the temporal stream. The first convolutional layer has 96 filters of size 7x7 with stride 2. This is followed by max pooling with size 3x3 and stride 2. The second convolutional layer has 256 filters of size 5x5 with stride 2. After that is another max pooling layer (3x3, stride 2). The third convolutional layer has 512 filters of size 3x3 with stride 1. The fo…

Výcviková data
tokens

They pretrain on ImageNet, and use UCF101 for actions. Its paper says "We introduce UCF101 which is currently the largest dataset of human actions. It consists of 101 action classes, over 13k clips and 27 hours of video data".

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Citace
3,786

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors
Nap poslední aktualizace
28 November 2025

Co čísla znamenají

Pozadí

Trajectory-pooled conv nets byl zveřejněn Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences, v zemi zaznamenané jako Hong Kong, během May 2015. Vydavatelská organizace je kategorizována jako academia,Academia.

funguje v oblasti Video, a je zaznamenán jako vykonávající úkol action recognition.

Protože váhy nejsou k dispozici, žádné z hardwarových údajů na tomto webu se na něj nevztahují.

Odpovědi

Trajectory-pooled conv nets — běžné otázky

01

Trajectory-pooled conv nets— Kdo to vytvořil?

Bylo to publikováno společností Chinese University of Hong Kong (CUHK),Chinese Academy of Sciences, zakládající se na Hong Kong, organizace zařazená jako academia,Academia.

02

Trajectory-pooled conv nets— Kdy byl vydán?

Bylo to zveřejněno v May 2015. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

03

Trajectory-pooled conv nets— K čemu se to používá?

funguje v oblasti Video, a je zaznamenáno jako zpracovávající úkol action recognition. Toto jsou oblasti, kolem nichž byl navržen; popisují záměr spíše než tvrdou hranici.

04

Trajectory-pooled conv nets— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

05

Trajectory-pooled conv nets— Je to OPEN SOURCE?

Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.

06

Trajectory-pooled conv nets— kolik má parametrů?

Má počet parametrů 9.1M. The input layer takes either a single RGB frame (224x224x3) for the spatial stream or a stack of 10 optical flow frames (224x224x20) for the temporal stream. The first convolutional layer has 96 filters of size 7x7 with stride 2. This is followed by max pooling with size 3x3 and stride 2. The second convolutional layer has 256 filters of size 5x5 with stride 2. After that is another max pooling layer (3x3, stride 2). The third convolutional layer has 512 filters of size 3x3 with stride 1. The fourth convolutional layer has 512 filters of size 3x3 with stride 1. The fifth convolutional layer has 512 filters of size 3x3 with stride 1. Next is a max pooling layer (3x3, stride 2). The fully-connected layers have 4096, 2048, and 101 neurons respectively. (7*7*20+1)*96 + (5*5*20+1)*256 + (3*3*20+1)*512 + (3*3*20+1)*512 + (3*3*20+1)*512 + 2*4096 + (4096+1)*2048 + (2048+1)*101 = 9106245. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 28 November 2025

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.