3-Layer-Tensor-Transformer+AdaHessian

Pesi chiusi University of California (UC) Berkeley,NERSC, Lawrence Berkeley National Laboratory June 2020

Nessuna stima

Nessun requisito hardware per questo modello

I pesi per questo modello non sono stati pubblicati, quindi non può essere scaricato o eseguito sul proprio hardware di qualsiasi dimensione. È accessibile solo attraverso il suo fornitore e nessun cambiamento della scheda grafica che.

In registrazione

specifiche complete

Tutto in archivio per questo modello. La maggior parte descrive come è stato addestrato piuttosto che come gira — contesto utile per giudicare quanto lavoro c'è stato dietro, e come si confronta con i modelli costruiti su una scala diversa..

Origine

Chi ha costruito questo modello, dove e quando è stato pubblicato.

Organizzazione
University of California (UC) Berkeley,NERSC, Lawrence Berkeley National Laboratory
Tipo di organizzazione
Academia,Government
Paese
United States of America
Pubblicato
1 June 2020
Autori
Zhewei Yao, Amir Gholami, Sheng Shen, Mustafa Mustafa, Kurt Keutzer, Michael W. Mahoney

Cosa fa

Le aree problematiche per cui è stato progettato il modello. Un modello può contenere diversi di ciascuno.

Dominio
Language
Compito
Language modeling, Translation

Dimensione

Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono la cifra che decide se si adatta a una determinata scheda grafica.

Dati di addestramento
tokens
Epoche
30

Disponibilità

Se puoi ottenere il modello e farlo funzionare sul tuo hardware, il che decide se alcune delle cifre della scheda grafica su questa pagina sono applicabili.

Pesi
Closed — provider access only
Accesso al modello
Unreleased
Codice di addestramento
Open source

MIT for code. doesn't have training script for PTB but looks fairly adaptable: https://github.com/amirgholami/ADAHESSIAN

Come è classificato

Etichette del dataset sorgente si applicano quando si tracciano modelli notevoli, e quanto è sicuro nell'entry.

Record fiducia
Confident
Citazioni
365
Dati di benchmark
3-Layer-Tensor-Transformer+AdaHessian

Fonti

Da dove proviene questo record e quando è stato controllato l'ultima volta.

Riferimento
ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning
Ultimo aggiornamento
25 May 2026

Cosa significano i numeri

Da dove è venuto

3-Layer-Tensor-Transformer+AdaHessian è stato pubblicato da University of California (UC) Berkeley,NERSC, Lawrence Berkeley National Laboratory, nel paese registrato come United States of America, durante June 2020. L'organizzazione di pubblicazione è classificata come academia,Government.

Funziona nel dominio di Language, ed è registrato come eseguire il compito di language modeling, Translation.

I suoi pesi non sono mai stati pubblicati, quindi può essere raggiunto solo attraverso il suo fornitore. Nessuna scheda GPU cambia questo.

Risposte

3-Layer-Tensor-Transformer+AdaHessian — domande comuni

01

3-Layer-Tensor-Transformer+AdaHessian— che GPU ho bisogno per eseguirlo?

Nessuno. Questo è un modello chiuso - i suoi pesi non sono mai stati pubblicati, quindi non può essere scaricato o eseguito sul tuo hardware a qualsiasi prezzo. È accessibile solo attraverso il suo fornitore.

02

3-Layer-Tensor-Transformer+AdaHessian— è open-source?

No. I pesi non sono stati pubblicati, quindi esiste solo come servizio controllato dal suo proprietario.

03

3-Layer-Tensor-Transformer+AdaHessian— quanti parametri ha?

Non è stato pubblicato alcun conteggio dei parametri per esso, motivo per cui non appare alcun dato sulla memoria o sulla velocità su questa pagina.

04

3-Layer-Tensor-Transformer+AdaHessian— chi l'ha creato?

È stato pubblicato da University of California (UC) Berkeley,NERSC, Lawrence Berkeley National Laboratory, basato su United States of America, un'organizzazione categorizzata come academia,Government.

05

3-Layer-Tensor-Transformer+AdaHessian— quando è stato rilasciato?

È stato pubblicato in June 2020. La capacità per parametro è migliorata considerevolmente da allora, quindi un modello più recente della stessa dimensione è spesso un uso migliore dello stesso hardware.

06

3-Layer-Tensor-Transformer+AdaHessian— A cosa serve?

Funziona nel dominio di Language, e viene registrato come gestire il compito di language modeling, Translation. I modelli portano frequentemente più di uno di ciascuno, e le etichette descrivono lo scopo piuttosto che i limiti di capacità.

Fonte

Pubblicazione originale

Ultimo aggiornamento del record 25 May 2026

L'altra direzione

Guardandolo dall'altro lato?

Questa pagina parte dal modello. Se possiedi già una scheda e vuoi sapere tutto ciò che farà funzionare, inizia dall'hardware invece.