STORM-B/8

Uzavřené váhy University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA 100.6M parametry December 2024

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA
Typ organizace
Academia,Academia,Academia,Industry
Země
United States of America
Publikováno
31 December 2024
Autoři
Jiawei Yang, Jiahui Huang, Yuxiao Chen, Yan Wang, Boyi Li, Yurong You, Apoorva Sharma, Maximilian Igl, Peter Karkus, Danfei Xu, Boris Ivanovic, Yue Wang, Marco Pavone

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
3D modeling
Úkol
3D reconstruction, 3D segmentation
Číselný formát
TF32

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
100.6M

A.3 Baseline Implementations: "The number of trainable parameters of these models are controlled to be similar, i.e., GS-LRM has 86.68M parameters, LGM has 103.29M parameters, while our default STORM has 100.60M parameters. 3.3 Implementation, Model architecture: "By default, we use a 12-layer Vision Transformer (ViT-B) (Dosovitskiy, 2020) with full attention and a patch size of 8, along with M = 16 motion tokens." https://github.com/NVlabs/GaussianSTORM?tab=readme-ov-file#training Training: "…

Výcviková data
tokens

4 Experiments, Datasets: "We primarily conduct experiments on the Waymo Open Dataset (Sun et al., 2020), which contains 1,000 sequences of driving logs: 798 sequences for training and 202 for validation. Each sequence consists of a 20-second video recorded at 10FPS." 10 frames/s * 20 s/scene = 200 frames/scene 200 frames/scene * 798 scene = 159600 frames (training) scene range: [0.1,20] s, or [1,200] frames Sampling scheme: 3.3 Implementation, Supervision and loss functions: "During traini…

Velikost dávky
64

Global batch size is 64; repo suggests per-GPU split of 4

Tréninkový běh

Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.

Tréninkový hardware
NVIDIA A100
Používané čipy
16
Příkon
12.6 kW

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
SOTA improvement

Abstract: "Extensive experiments on public datasets show that STORM achieves precise dynamic scene reconstruction, surpassing state-of-the-art per-scene optimization methods (+4.3 to 6.6 PSNR) and existing feed-forward approaches (+2.1 to 4.7 PSNR) in dynamic regions. STORM reconstructs large-scale outdoor scenes in 200ms, supports real-time rendering, and outperforms competitors in scene flow estimation, improving 3D EPE by 0.422m and Acc5 by 28.02%." See Tables 1,2,3 - comparisons to EmerNeRF…

Záznam důvěry
Confident
Citace
38

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
STORM: Spatio-Temporal Reconstruction Model for Large-Scale Outdoor Scenes
Nap poslední aktualizace
25 May 2026

Co čísla znamenají

Odkud to přišlo

STORM-B/8 byl zveřejněn University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA, v zemi zaznamenané jako United States of America, během December 2024. Kategorie, do které vydavatel spadá, je academia,Academia,Academia,Industry.

funguje v oblasti 3D modeling, a je zaznamenán jako vykonávající úkol 3D reconstruction, 3D segmentation.

Jeho váhy nikdy nebyly zveřejněny, takže k němu lze přistupovat pouze prostřednictvím jeho poskytovatele. Žádná změna grafické karty to nezmění.

Trénink a původ

Je sledováno v základním datasetu z jednoho konkrétního důvodu: sOTA improvement.

Odpovědi

STORM-B/8 — běžné otázky

01

STORM-B/8— Je to OPEN SOURCE?

Licencování nikdy nebylo zaznamenáno v našich zdrojových datech. Neuváděné licencování považujeme za uzavřené, protože nezaznamenaná licence není na kterou by se dalo spoléhat.

02

STORM-B/8— kolik má parametrů?

Má počet parametrů 100.6M. A.3 Baseline Implementations: "The number of trainable parameters of these models are controlled to be similar, i.e., GS-LRM has 86.68M parameters, LGM has 103.29M parameters, while our default STORM has 100.60M parameters. 3.3 Implementation, Model architecture: "By default, we use a 12-layer Vision Transformer (ViT-B) (Dosovitskiy, 2020) with full attention and a patch size of 8, along with M = 16 motion tokens." https://github.com/NVlabs/GaussianSTORM?tab=readme-ov-file#training Training: "Multi-GPU example that reproduces the paper's STORM-B/8 model: https://github.com/NVlabs/GaussianSTORM/blob/main/storm/models/storm.py def STORM_B_8(**kwargs): return STORM(patch_size=8, embed_dim=768, depth=12, num_heads=12, **kwargs) def STORM_L_8(**kwargs): return STORM(patch_size=8, embed_dim=1024, depth=24, num_heads=16, **kwargs) def STORM_B_16(**kwargs): return STORM(patch_size=16, embed_dim=768, depth=12, num_heads=12, **kwargs) def STORM_L_16(**kwargs): return STORM(patch_size=16, embed_dim=1024, depth=24, num_heads=16, **kwargs) def STORM_XL_8(**kwargs): return STORM(patch_size=8, embed_dim=1152, depth=28, num_heads=16, **kwargs) def STORM_H_8(**kwargs): return STORM(patch_size=8, embed_dim=1280, depth=32, num_heads=16, **kwargs) def STORM_H_16(**kwargs): return STORM(patch_size=16, embed_dim=1280, depth=32, num_heads=16, **kwargs) PyTorch model.parameters(): with "dummy decoder": STORM-B/8: 100.60M (100,598,707) STORM-L/8: 327.08M (327,081,139) STORM-XL/8: 476.55M (476,547,379) STORM-H/8: 665.91M (665,905,587) STORM-B/16: 103.42M (103,417,907) STORM-L/16: 330.82M (330,817,331) STORM-H/16: 670.56M (670,558,771) with "conv decoder", i.e. "Latent-STORM" (adds ~30M): STORM-B/8: 133.23M (133,230,019) STORM-L/8: 359.13M (359,125,699) STORM-XL/8: 508.30M (508,298,563) STORM-H/8: 697.36M (697,363,395) STORM-B/16: 134.21M (134,211,523) STORM-L/16: 360.43M (360,434,371) STORM-H/16: 699.00M (698,999,235). Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

03

STORM-B/8— Kdo to vytvořil?

Bylo to publikováno společností University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA, zakládající se na United States of America, organizace zařazená jako academia,Academia,Academia,Industry.

04

STORM-B/8— Kdy byl vydán?

Bylo to zveřejněno v December 2024. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

05

STORM-B/8— K čemu se to používá?

funguje v oblasti 3D modeling, a je zaznamenáno jako zpracovávající úkol 3D reconstruction, 3D segmentation. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.

06

STORM-B/8— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 25 May 2026

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.