STORM-B/8

Geschlossene Gewichtungen University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA 100.6M Parameter December 2024

Keine Schätzung

Keine Hardwareanforderungen für dieses Modell

Die Gewichte für dieses Modell wurden nicht veröffentlicht, daher kann es nicht heruntergeladen oder auf Ihrer eigenen Hardware in beliebiger Größe betrieben werden. Es ist nur über seinen Anbieter erreichbar, und keine Grafikkarte ändert das..

Aufgezeichnet

Volle Spezifikation

Alles, was in unserer Datenbank für dieses Modell aufgezeichnet ist. Der Großteil beschreibt, wie es trainiert wurde, anstatt wie es läuft — nützlicher Kontext zur Beurteilung, wie viel Arbeit darin steckt und wie es sich mit Modellen vergleicht, die in einem anderen Maßstab erstellt wurden..

Ursprung

Wer hat dieses Modell gebaut, wo und wann es veröffentlicht wurde.

Organisation
University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA
Organisationsart
Academia,Academia,Academia,Industry
Land
United States of America
Veröffentlicht
31 December 2024
Autoren
Jiawei Yang, Jiahui Huang, Yuxiao Chen, Yan Wang, Boyi Li, Yurong You, Apoorva Sharma, Maximilian Igl, Peter Karkus, Danfei Xu, Boris Ivanovic, Yue Wang, Marco Pavone

Was es tut

Die Problemfelder, für die das Modell entwickelt wurde. Ein Modell kann mehrere davon tragen.

Domain
3D modeling
Aufgabe
3D reconstruction, 3D segmentation
Numerisches Format
TF32

Größe

Wie groß das Modell ist und wie viele Daten damit trainiert wurden. Parameter sind die Zahl, die entscheidet, ob es auf einer bestimmten GPU-Karte passt.

Parameter
100.6M

A.3 Baseline Implementations: "The number of trainable parameters of these models are controlled to be similar, i.e., GS-LRM has 86.68M parameters, LGM has 103.29M parameters, while our default STORM has 100.60M parameters. 3.3 Implementation, Model architecture: "By default, we use a 12-layer Vision Transformer (ViT-B) (Dosovitskiy, 2020) with full attention and a patch size of 8, along with M = 16 motion tokens." https://github.com/NVlabs/GaussianSTORM?tab=readme-ov-file#training Training: "…

Trainingsdaten
tokens

4 Experiments, Datasets: "We primarily conduct experiments on the Waymo Open Dataset (Sun et al., 2020), which contains 1,000 sequences of driving logs: 798 sequences for training and 202 for validation. Each sequence consists of a 20-second video recorded at 10FPS." 10 frames/s * 20 s/scene = 200 frames/scene 200 frames/scene * 798 scene = 159600 frames (training) scene range: [0.1,20] s, or [1,200] frames Sampling scheme: 3.3 Implementation, Supervision and loss functions: "During traini…

Batch-Größe
64

Global batch size is 64; repo suggests per-GPU split of 4

Der Trainingslauf

Was es physisch gekostet hat, um zu trainieren: welche Chips, wie viele, wie lange und was das aus der Wand gezogen hat.

Trainingshardware
NVIDIA A100
Verwendete Chips
16
Stromverbrauch
12.6 kW

Wie es klassifiziert ist

Labels, die das Quell-Datenset anwendet, wenn bemerkenswerte Modelle verfolgt werden, und wie zuversichtlich es in den Eintrag ist.

Warum es verfolgt wird
SOTA improvement

Abstract: "Extensive experiments on public datasets show that STORM achieves precise dynamic scene reconstruction, surpassing state-of-the-art per-scene optimization methods (+4.3 to 6.6 PSNR) and existing feed-forward approaches (+2.1 to 4.7 PSNR) in dynamic regions. STORM reconstructs large-scale outdoor scenes in 200ms, supports real-time rendering, and outperforms competitors in scene flow estimation, improving 3D EPE by 0.422m and Acc5 by 28.02%." See Tables 1,2,3 - comparisons to EmerNeRF…

Aufzeichnungsgenauigkeit
Confident
Zitationen
38

Quellen

Woher dieser Datensatz stammt und wann er zuletzt überprüft wurde.

Referenz
STORM: Spatio-Temporal Reconstruction Model for Large-Scale Outdoor Scenes
Zuletzt aktualisiert
25 May 2026

Was die Zahlen bedeuten

Woher es kam

STORM-B/8 wurde veröffentlicht von University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA, im Land aufgezeichnet als United States of America, während December 2024. Die Kategorie, in die der Herausgeber fällt, ist academia,Academia,Academia,Industry.

Es funktioniert im Bereich von 3D modeling, und wird als die Aufgabe von aufgezeichnet 3D reconstruction, 3D segmentation.

Seine Gewichte wurden niemals veröffentlicht, daher kann es nur über seinen Anbieter erreicht werden. Keine Grafikkarten ändern das.

Training und Herkunft

Es wird aus einem bestimmten Grund im zugrunde liegenden Datensatz verfolgt: sOTA improvement.

Antworten

STORM-B/8 — Häufige Fragen

01

STORM-B/8— Ist es Open-Source?

Die Lizenzierung wurde nie in unseren Quelldaten aufgezeichnet. Wir behandeln nicht angegebene Lizenzen als geschlossen, da eine nicht aufgezeichnete Lizenz keine ist, auf die man sich verlassen kann.

02

STORM-B/8— Wie viele Parameter hat es?

Es hat eine Parameteranzahl von 100.6M. A.3 Baseline Implementations: "The number of trainable parameters of these models are controlled to be similar, i.e., GS-LRM has 86.68M parameters, LGM has 103.29M parameters, while our default STORM has 100.60M parameters. 3.3 Implementation, Model architecture: "By default, we use a 12-layer Vision Transformer (ViT-B) (Dosovitskiy, 2020) with full attention and a patch size of 8, along with M = 16 motion tokens." https://github.com/NVlabs/GaussianSTORM?tab=readme-ov-file#training Training: "Multi-GPU example that reproduces the paper's STORM-B/8 model: https://github.com/NVlabs/GaussianSTORM/blob/main/storm/models/storm.py def STORM_B_8(**kwargs): return STORM(patch_size=8, embed_dim=768, depth=12, num_heads=12, **kwargs) def STORM_L_8(**kwargs): return STORM(patch_size=8, embed_dim=1024, depth=24, num_heads=16, **kwargs) def STORM_B_16(**kwargs): return STORM(patch_size=16, embed_dim=768, depth=12, num_heads=12, **kwargs) def STORM_L_16(**kwargs): return STORM(patch_size=16, embed_dim=1024, depth=24, num_heads=16, **kwargs) def STORM_XL_8(**kwargs): return STORM(patch_size=8, embed_dim=1152, depth=28, num_heads=16, **kwargs) def STORM_H_8(**kwargs): return STORM(patch_size=8, embed_dim=1280, depth=32, num_heads=16, **kwargs) def STORM_H_16(**kwargs): return STORM(patch_size=16, embed_dim=1280, depth=32, num_heads=16, **kwargs) PyTorch model.parameters(): with "dummy decoder": STORM-B/8: 100.60M (100,598,707) STORM-L/8: 327.08M (327,081,139) STORM-XL/8: 476.55M (476,547,379) STORM-H/8: 665.91M (665,905,587) STORM-B/16: 103.42M (103,417,907) STORM-L/16: 330.82M (330,817,331) STORM-H/16: 670.56M (670,558,771) with "conv decoder", i.e. "Latent-STORM" (adds ~30M): STORM-B/8: 133.23M (133,230,019) STORM-L/8: 359.13M (359,125,699) STORM-XL/8: 508.30M (508,298,563) STORM-H/8: 697.36M (697,363,395) STORM-B/16: 134.21M (134,211,523) STORM-L/16: 360.43M (360,434,371) STORM-H/16: 699.00M (698,999,235). Diese Zahl ist die Gesamtsumme, und sie bestimmt, wie viel MEMORY das MODEL benötigt – ungefähr ein halbes Gigabyte pro Milliarde bei der Kompression, die die meisten Menschen verwenden.

03

STORM-B/8— Wer hat es erstellt?

Es wurde veröffentlicht von University of Southern California,Georgia Institute of Technology,Stanford University,NVIDIA, basiert auf United States of America, eine als kategorisierte Organisation academia,Academia,Academia,Industry.

04

STORM-B/8— Wann wurde es veröffentlicht?

Es wurde veröffentlicht in December 2024. Die Fähigkeit pro Parameter hat sich erheblich verbessert, sodass ein neueres Modell derselben Größe oft die bessere Nutzung derselben Hardware darstellt.

05

STORM-B/8— Wofür wird es verwendet?

Es funktioniert im Bereich von 3D modeling, und wird als Bewältigung der Aufgabe von 3D reconstruction, 3D segmentation. Ein Modell kann mehrere von jedem tragen, daher sind dies die Bereiche, für die es gebaut wurde, anstatt eine Begrenzung dafür, was es versuchen wird.

06

STORM-B/8— Welche GPU benötige ich, um es auszuführen?

Dieses ist ein geschlossenes Modell — seine Gewichte wurden nie veröffentlicht, sodass es zu keinem Preis heruntergeladen oder auf Ihrer eigenen Hardware ausgeführt werden kann. Es ist nur über seinen Anbieter erreichbar.

Quelle

Originalveröffentlichung

Letzte Aktualisierung des Protokolls 25 May 2026

Die andere Richtung

Von der anderen Seite aus betrachten?

Diese Seite beginnt mit dem Modell. Wenn Sie bereits eine Karte besitzen und alles wissen möchten, was sie ausführen wird, Starte stattdessen von der Hardware.