ERNIE 3.0 Titan

Κλειστές βαρύτητες Baidu,Peng Cheng Laboratory 260B παράμετροι December 2021

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Baidu,Peng Cheng Laboratory
Τύπος οργανισμού
Industry,Academia
Χώρα
China
Δημοσιευμένο
23 December 2021
Συγγραφείς
Shuohuan Wang, Yu Sun, Yang Xiang, Zhihua Wu, Siyu Ding, Weibao Gong, Shikun Feng

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling, Language modeling/generation, Relation extraction, Sentiment classification, Text classification
Αριθμητική μορφή
FP16

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
260B

"[We] developed... distributed training technology, including fine-grained parallelism, heterogeneous hardware-aware training, and fault tolerance mechanism to train the 260B model on both Nvidia V100 GPU and Ascend 910 NPU clusters." See also: https://twitter.com/BaiduResearch/status/1468633977242243078?t=6q4zuLNdTSc4GUBe9OM5Aw&s=19

Δεδομένα εκπαίδευσης
668,000,000,000 tokens

"To ensure the success of the pre-training of ERNIE 3.0 Titan, we utilize the ERNIE 3.0 Corpus [ 2 ], a large-scale, wide-variety, and high-quality Chinese text corpora amounting to 4TB" Assuming 167M words/tokens per GB

Μέγεθος παρτίδας
1,048,576

"The maximum sequence length of context and the memory length of language generation is 512 and 128, respectively" In table 1, they use a global batch size of 512 when data parallelism is "1" and 2048 when DP is "4". Not sure I fully understand this part but I guess they'd use parallelism as much as possible given how they talk about it. 2048 * 512 = 1048576.

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
1 × 10²⁴ FLOP

The paper suggests that ERNIE 3.0 Titan uses more compute than GPT-3. This is consistent with the 6ND approximation. C = 6ND = 6 (FLOP/param/token) * (260B params) * (668B tokens) = 1.0421*10^24 FLOP

Πώς ιδρύθηκε
Operation counting

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA Tesla V100 DGXS 32 GB,Huawei Ascend 910
χρησιμοποιούμενα τσιπ
1,920
Κέντρο δεδομένων
Peng Cheng Cloud Brain II, Paper on Ernie 3.0

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Hosted access (no API)
Κωδικός εκπαίδευσης
Unreleased

The Ernie 3.0 Titan model was used in Ernie bot. Today, ERNIE has been widely deployed across finance, healthcare, insurance, equity, Internet, logistics, and other fields. http://research.baidu.com/Blog/index-view?id=165

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Μοντέλο Frontier
Yes
Μοντέλο Θεμελίωσης
Yes
Πιθανώς πάνω από 10²³ FLOP
Yes
Γιατί παρακολουθείται
SOTA improvement

"Empirical results show that the ERNIE 3.0 Titan outperforms the state-of-the-art models on 68 NLP datasets."

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
87

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
ERNIE 3.0 Titan: Exploring Larger-scale Knowledge Enhanced Pre-training for Language Understanding and Generation
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Υπόβαθρο

ERNIE 3.0 Titan δημοσιεύθηκε από Baidu,Peng Cheng Laboratory, στην χώρα καταγεγραμμένη ως China, κατά τη διάρκεια December 2021. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry,Academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling, Language modeling/generation, Relation extraction, Sentiment classification, Text classification.

Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.

Πώς εκπαιδεύτηκε

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 1 × 10²⁴ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla V100 DGXS 32 GB,Huawei Ascend 910. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 668,000,000,000 κωδικοί κειμένου

Ο λόγος που εμφανίζεται σε αυτόν τον κατάλογο είναι: sOTA improvement.

Απαντήσεις

ERNIE 3.0 Titan — κοινές ερωτήσεις

01

ERNIE 3.0 Titan— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

02

ERNIE 3.0 Titan— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

03

ERNIE 3.0 Titan— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 260B. "[We] developed... distributed training technology, including fine-grained parallelism, heterogeneous hardware-aware training, and fault tolerance mechanism to train the 260B model on both Nvidia V100 GPU and Ascend 910 NPU clusters." See also: https://twitter.com/BaiduResearch/status/1468633977242243078?t=6q4zuLNdTSc4GUBe9OM5Aw&s=19. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

04

ERNIE 3.0 Titan— ποιος το δημιούργησε;

Δημοσιεύθηκε από Baidu,Peng Cheng Laboratory, βασισμένο σε China, μία οργάνωση κατηγοριοποιημένη ως industry,Academia.

05

ERNIE 3.0 Titan— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε December 2021. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

06

ERNIE 3.0 Titan— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling, Language modeling/generation, Relation extraction, Sentiment classification, Text classification. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

07

ERNIE 3.0 Titan— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 1 × 10²⁴ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA Tesla V100 DGXS 32 GB,Huawei Ascend 910. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 25 May 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.