DeepNet

Κλειστά βάρη Microsoft Research 3.2B Παραμέτροι March 2022

Χωρίς εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Τα βάρη αυτού του μοντέλου δεν έχουν δημοσιευθεί, επομένως δεν μπορεί να κατεβεί ή να τρέξει σε δικό σας υλικό οποιουδήποτε μεγέθους. Είναι προσβάσιμο μόνο μέσω του παρόχου του και καμία κάρτα γραφικών δεν το αλλάζει αυτό.

Σε εγγραφή

Πλήρης προδιαγραφή

Όλα τα δεδομένα σχετικά με αυτό το μοντέλο. Τα περισσότερα περιγράφουν πώς εκπαιδεύτηκε παρά πώς τρέχει — χρήσιμο πλαίσιο για την αξιολόγηση του πόσο δουλειά απαιτήθηκε και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα.

Προέλευση

Ποιος δημιούργησε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε;

Οργάνωση
Microsoft Research
Τύπος οργάνωσης
Industry
Χώρα
United States of America
Δημοσιευμένο
1 March 2022
Συγγραφείς
Hongyu Wang, Shuming Ma, Li Dong, Shaohan Huang, Dongdong Zhang, Furu Wei

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες κατασκευάστηκε το μοντέλο. Ένα μοντέλο μπορεί να περιέχει αρκετές από κάθε μία.

Τομέας
Language
Εντολή
Language modeling, Translation, Language modeling/generation
Αριθμητική μορφή
FP16

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα εκπαιδεύτηκε. Οι παράμετροι είναι το νούμερο που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

Παραμέτροι
3.2B

"Remarkably, on a multilingual benchmark with 7,482 translation directions, our 200-layer model with 3.2B parameters significantly outperforms the 48-layer state-of-the-art model with 12B parameters by 5 BLEU points, which indicates a promising scaling direction" EDIT 05/05/2022: The 12B model was presented in an earlier paper. This paper presents a 3.2B model

Δεδομένα εκπαίδευσης
272,629,760,000 tokens

" The final data consists of 102 languages, 1932 directions, and 12B sentence pairs."

Εποχές
4

Υπολογιστική εκπαίδευση

Η αριθμητική που εκτελείται για την εκπαίδευση του μοντέλου, μετρημένη σε αριθμητικές πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της εκπαίδευσης, όχι πόσο γρήγορα απαντά το ολοκληρωμένο μοντέλο.

Πώς ιδρύθηκε
Comparison with other models

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το εκτελέσετε στον δικό σας εξοπλισμό, κάτι που αποφασίζει αν κάποια από τα στοιχεία της κάρτας γραφικών σε αυτή τη σελίδα εφαρμόζονται.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κώδικας εκπαίδευσης
Open source

model code is said to be part of the torchscale library (I am not sure if full pre-training code is here): https://github.com/microsoft/torchscale MIT license

Πώς ταξινομείται

Ετικέτες που εφαρμόζει το πηγαίο σύνολο δεδομένων κατά την παρακολούθηση σημαντικών μοντέλων, και πόσο σίγουρο είναι για την είσοδο.

Γιατί παρακολουθείται
SOTA improvement

"Remarkably, on a multilingual benchmark with 7,482 translation directions, our 200-layer model with 3.2B parameters significantly outperforms the 48-layer state-of-the-art model with 12B parameters by 5 BLEU points"

Καταγραφή εμπιστοσύνης
Confident
Αναφορές
244

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία.

Αναφορά
DeepNet: Scaling Transformers to 1,000 Layers
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

DeepNet was published by Microsoft Research, in United States of America, in March 2022. It comes out of industry.

It works in Language, and is recorded as doing language modeling, Translation, Language modeling/generation.

Τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε μπορεί να αποκτηθεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προέλευση

It was trained on about 272,629,760,000 tokens of text.

It is tracked in the underlying dataset for one reason in particular: sOTA improvement.

Απαντήσεις

DeepNet — Συχνές ερωτήσεις

01

Who created DeepNet?

DeepNet was published by Microsoft Research, based in United States of America, categorised as industry.

02

When was DeepNet released?

DeepNet was published in March 2022. Capability per parameter has improved considerably since, so a newer model of the same size is often the better use of the same hardware.

03

What is DeepNet used for?

DeepNet works in Language, and is recorded as handling language modeling, Translation, Language modeling/generation. A model can carry several of each, so these are the areas it was built for rather than a limit on what it will attempt.

04

What GPU do I need to run DeepNet?

None. DeepNet is a closed model — its weights were never published, so it cannot be downloaded or run on your own hardware at any price. It is reachable only through its provider.

05

Is DeepNet open source?

No. DeepNet has not had its weights published, so it exists only as a service controlled by its owner.

06

How many parameters does DeepNet have?

DeepNet has 3.2B parameters. "Remarkably, on a multilingual benchmark with 7,482 translation directions, our 200-layer model with 3.2B parameters significantly outperforms the 48-layer state-of-the-art model with 12B parameters by 5 BLEU points, which indicates a promising scaling direction" EDIT 05/05/2022: The 12B model was presented in an earlier paper. This paper presents a 3.2B model. That figure is the total, and it is what decides how much memory the model needs — roughly half a gigabyte per billion at the compression most people use.

Πηγή

Αρχική δημοσίευση

Τελευταία ενημέρωση αρχείου 25 May 2026

Η άλλη κατεύθυνση

Βλέποντάς το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινάει από το μοντέλο. Αν ήδη διαθέτετε μια κάρτα και θέλετε να γνωρίζετε όλα όσα θα τρέξει, Ξεκινήστε από το υλικό αντί..