Transformer + Simple Recurrent Unit

Uzavřené váhy ASAPP,Cornell University,Google,Princeton University 90M parametry September 2018

Žádný odhad

Žádné hardwarové požadavky pro tento model

Hmotnosti pro tento model nebyly zveřejněny, takže jej nelze stáhnout ani spustit na vlastním hardwaru v žádné velikosti. Je dostupný pouze prostřednictvím svého poskytovatele, a žádná změna grafické karty to nezmění..

Na záznamu

Plná specifikace

Všechno o tomto modelu v záznamech. Většina z toho popisuje, jak byl trénován, spíše než jak funguje — užitečný kontext pro posouzení, kolik práce do něj bylo vynaloženo, a jak se srovnává s modely postavenými na jiné úrovni..

Původ

Kdo vytvořil tento model, kde a kdy byl publikován.

Organizace
ASAPP,Cornell University,Google,Princeton University
Typ organizace
Industry,Academia,Industry,Academia
Země
United States of America
Publikováno
17 September 2018
Autoři
Tao Lei, Yu Zhang, Sida I. Wang, Hui Dai, Yoav Artzi

Co to dělá

Problémové oblasti, pro které byl model vytvořen. Model může obsahovat několik z každého.

Doména
Language
Úkol
Translation

Velikost

Jak velký je model a kolik dat byl trénován. Parametry jsou číslo, které rozhoduje, zda se vejde na danou grafickou kartu.

parametry
90M

5-layer model, Table 3

Výcviková data
112,500,000 tokens
Epochy
40

Výpočty pro trénink

Aritmetika prováděná k trénování modelu, měřená v operacích s plovoucí desetinnou čárkou. Je to měřítko toho, kolik stál tréninkový běh, ne jak rychle hotový model na vás odpovídá.

Výpočty pro trénink
1.1 × 10¹⁹ FLOP

"We use a single NVIDIA Tesla V100 GPU for each model. The published results were obtained using 8 GPUs in parallel, which provide a large effective batch size during training. To approximate the setup, we update the model parameters every 5×5120 tokens and use 16,000 warm-up steps following OpenNMT suggestions. We train each model for 40 epochs (250,000 steps), and perform 3 independent trials for each model configuration. A single run takes about 3.5 days with a Tesla V100 GPU." 125 trillion …

Jak bylo ustanoveno
Hardware

Tréninkový běh

Co fyzicky vyžadovalo trénování: které čipy, kolik, jak dlouho a co to vyžadovalo ze zásuvky.

Tréninkový hardware
NVIDIA V100
Používané čipy
8
Příkon
5.0 kW
Náklady na výpočet
$45

Dostupnost

Zda můžete získat model a spustit ho na svém vlastním hardwaru, což rozhoduje o tom, zda se některé z čísel grafických karet na této stránce vztahují.

Hmotnosti
Closed — provider access only
Přístup k modelu
Unreleased
Tréninkový kód
Unreleased

repo, but no training code for translation: https://github.com/taolei87/sru

Jak je to klasifikováno

Štítky aplikačních datových sad, které se používají při sledování významných modelů, a jak jistý je ve záznamu.

Proč je to sledováno
SOTA improvement

"We use the state-of-the-art Transformer model of Vaswani et al. (2017) as our base architecture... When SRU is incorporated into the architecture, both the 4-layer and 5-layer model outperform the Transformer base model"

Záznam důvěry
Confident
Citace
306

Žrovy

Odkud tento záznam pochází a kdy byl naposledy zkontrolován.

Reference
Simple Recurrent Units for Highly Parallelizable Recurrence
Nap poslední aktualizace
25 May 2026

Co čísla znamenají

Odkud to přišlo

Transformer + Simple Recurrent Unit byl zveřejněn ASAPP,Cornell University,Google,Princeton University, v zemi zaznamenané jako United States of America, během September 2018. Kategorie, do které vydavatel spadá, je industry,Academia,Industry,Academia.

funguje v oblasti Language, a je zaznamenán jako vykonávající úkol translation.

Toto je uzavřený model: trénované hodnoty zůstaly u toho, kdo je vyprodukoval, a není k dispozici žádná místní verze k spuštění.

Co bylo zapotřebí k jeho vybudování

Trénování si vyžádalo výpočetní rozpočet přibližně 1.1 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako NVIDIA V100. Tato částka měří, kolik stál výroba modelu, a nemá žádný vliv na to, jak rychle odpovídá.

Bylo to trénováno na korpusu asi 112,500,000 tokeny textu

Důvod, proč se to v tomto katalogu vůbec objevuje: sOTA improvement.

Odpovědi

Transformer + Simple Recurrent Unit — běžné otázky

01

Transformer + Simple Recurrent Unit— kolik má parametrů?

Má počet parametrů 90M. 5-layer model, Table 3. Tato cifra je celková a rozhoduje o tom, kolik VRAM model potřebuje — přibližně půl gigabajtu na miliardu při kompresi, kterou většina lidí používá.

02

Transformer + Simple Recurrent Unit— Kdo to vytvořil?

Bylo to publikováno společností ASAPP,Cornell University,Google,Princeton University, zakládající se na United States of America, organizace zařazená jako industry,Academia,Industry,Academia.

03

Transformer + Simple Recurrent Unit— Kdy byl vydán?

Bylo to zveřejněno v September 2018. Schopnost na parametr se od té doby výrazně zlepšila, takže novější model stejné velikosti je často lepším využitím stejného hardwaru.

04

Transformer + Simple Recurrent Unit— K čemu se to používá?

funguje v oblasti Language, a je zaznamenáno jako zpracovávající úkol translation. Model může nést několik z každého, takže to jsou oblasti, pro které byl navržen, spíše než omezení toho, co se pokusí.

05

Transformer + Simple Recurrent Unit— kolik výpočetního výkonu bylo použito k jeho trénování?

Trénink spotřeboval kolem 1.1 × 10¹⁹ FLOP, na hardwaru zaznamenáno jako NVIDIA V100. To měří, co stálo výrobu modelu, a neříká nic o tom, jak rychle odpovídá po natrénování — rychlost inferencí závisí na šířce pásma paměti, nikoli na rozpočtu na trénink.

06

Transformer + Simple Recurrent Unit— Jakou GPU potřebuji k jejímu spuštění?

Žádné. Toto je uzavřený model — jeho váhy nikdy nebyly zveřejněny, takže jej nelze stáhnout nebo spustit na vlastním hardwaru za žádnou cenu. Je dostupný pouze prostřednictvím jeho poskytovatele.

07

Transformer + Simple Recurrent Unit— Je to OPEN SOURCE?

Ne. Jeho váhy nebyly zveřejněny, takže existuje pouze jako služba řízená jeho vlastníkem.

Zdroj

Původní publikace

Nahrávka naposledy aktualizována 25 May 2026

Druhý směr

Díváte se na to z druhé strany?

Tato stránka začíná od modelu. Pokud již vlastníte kartu a chcete vědět všechno, co bude spuštěno, začněte raději od hardwaru.