VQGAN + CLIP

Otevřít váhy Heidelberg University December 2020

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti tohoto modelu jsou otevřené, ale žádný počet parametrů pro něj nebyl zveřejněn. Každé číslo týkající se paměti a rychlosti vychází z této hodnoty, takže bychom raději nic neukázali, než fabrikaovaný odhad..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
Heidelberg University
Typ organizace
Academia
Země
Germany
Publikováno
17 December 2020
Autoři
Patrick Esser, Robin Rombach, Björn Ommer

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Image generation
Úkol
Text-to-image

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

Výcviková data
251,988,480,000 tokens

I'm confused - I guess they pretrained on several different datasets? I think the model is also able to do zero-shot learning

Dostupnost

Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.

Hmotnosti
Open — downloadable
Přístup k modelu
Open weights (unrestricted)
Tréninkový kód
Open source

MIT license https://github.com/CompVis/taming-transformers

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
Highly cited,SOTA improvement

"The results shows that the transformer consistently outperforms PixelSNAIL across all tasks when trained for the same amount of time and the gap increases even further when trained for the same number of steps." "obtain the state of the art among autoregressive models on class-conditional ImageNet"

Záznam důvěry
Unknown
Citace
4,226

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
Taming Transformers for High-Resolution Image Synthesis
Nap poslední aktualizace
25 May 2026

Co čísla znamenají

Pozadí

VQGAN + CLIP byl zveřejněn Heidelberg University, v zemi zaznamenané jako Germany, během December 2020. Kategorie, do které vydavatel spadá, je academia.

funguje v oblasti Image generation, a je zaznamenán jako vykonávající úkol text-to-image.

Zveřejněné váhy znamenají, že model běží na vašem stroji, nikoli na stroji někoho jiného, což činí otázku ohledně hardwaru níže odpovídatelnou.

Co bylo zapotřebí k jeho vybudování

Tréninková sada běžela na přibližně 251,988,480,000 tokeny textu

Důvod, proč se to v tomto katalogu vůbec objevuje: highly cited,SOTA improvement.

Odpovědi

VQGAN + CLIP — běžné otázky

01

VQGAN + CLIP— kolik má parametrů?

Pro něj nebyl zveřejněn žádný počet parametrů, a proto se na této stránce neobjevují žádné údaje o paměti nebo rychlosti.

02

VQGAN + CLIP— Kdo to vytvořil?

Bylo to publikováno společností Heidelberg University, zakládající se na Germany, organizace zařazená jako academia.

03

VQGAN + CLIP— Kdy byl vydán?

Bylo to zveřejněno v December 2020. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

04

VQGAN + CLIP— K čemu se to používá?

funguje v oblasti Image generation, a je zaznamenáno jako zpracovávající úkol text-to-image. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.

05

VQGAN + CLIP— kde si to mohu stáhnout?

Váhy jsou zveřejněny, i když nemáme odkaz na repozitář. Tato stránka vypočítává hardwarové požadavky spíše než aby hostila modelové soubory.

06

VQGAN + CLIP— Jakou GPU potřebuji k jejímu spuštění?

Nemůžeme říct. Má otevřené váhy, ale žádný počet parametrů pro něj nebyl zveřejněn a každý výpočet paměti a rychlosti začíná od toho čísla. Raději bychom ukázali nic než vykonstruovaný odhad.

07

VQGAN + CLIP— Je to OPEN SOURCE?

Jeho váhy jsou zveřejněny, takže si je lze stáhnout a spustit na vlastním hardwaru. Všimněte si, že open WEIGHTS není totéž co open SOURCE v plném smyslu — neříká nic o tréninkových datech, tréninkovém kódu nebo obchodních podmínkách připojených.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 25 May 2026

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.