DITTO

Κλειστές βαρύτητες Tsinghua University,Apple,Westlake University,Chinese University of Hong Kong (CUHK) 750M παράμετροι June 2022

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Tsinghua University,Apple,Westlake University,Chinese University of Hong Kong (CUHK)
Τύπος οργανισμού
Academia,Industry,Academia,Academia
Χώρα
China, United States of America, Hong Kong
Δημοσιευμένο
6 June 2022
Συγγραφείς
Jin Xu, Xiaojiang Liu, Jianhao Yan, Deng Cai, Huayang Li, Jian Li

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling/generation, Text summarization
Αριθμητική μορφή
FP16

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
750M

"We train a Transformer model (750M parameters, similar to GPT-2 Large)" "Specifically, we use a 16-layer Transformer with 8 attention heads, hidden size 1024 and fully-connected dimension 4096."

Δεδομένα εκπαίδευσης
103,000,000 tokens
Εποχές
7.16

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
3.3 × 10¹⁸ FLOP

6 FLOP / token / parameter * 160000 steps * 3 samples per batch * 1536 tokens per sample * 750000000 parameters = 3.31776 × 10^18 FLOP

Πώς ιδρύθηκε
Operation counting

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA V100
χρησιμοποιούμενα τσιπ
8
Κατανάλωση ενέργειας
4.8 kW

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Open source

open code https://github.com/Jxu-Thu/DITTO training: https://github.com/Jxu-Thu/DITTO/blob/main/train.py

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
SOTA improvement

Achieves SOTA on CNN/DailyMail by fine-tuning and improving on BART-large, which is SOTA

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
109
Δεδομένα αναφοράς
DITTO

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Learning to Break the Loop: Analyzing and Mitigating Repetitions for Neural Text Generation
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

DITTO δημοσιεύθηκε από Tsinghua University,Apple,Westlake University,Chinese University of Hong Kong (CUHK), στην χώρα καταγεγραμμένη ως China, κατά τη διάρκεια June 2022. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως academia,Industry,Academia,Academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation, Text summarization.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προελεύσεις

Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 3.3 × 10¹⁸ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 103,000,000 κωδικοί κειμένου

Αυτή παρακολουθείται στο υποκείμενο σύνολο δεδομένων για έναν συγκεκριμένο λόγο: sOTA improvement.

Απαντήσεις

DITTO — κοινές ερωτήσεις

01

DITTO— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 3.3 × 10¹⁸ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

02

DITTO— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

DITTO— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

04

DITTO— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 750M. "We train a Transformer model (750M parameters, similar to GPT-2 Large)" "Specifically, we use a 16-layer Transformer with 8 attention heads, hidden size 1024 and fully-connected dimension 4096.". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

DITTO— ποιος το δημιούργησε;

Δημοσιεύθηκε από Tsinghua University,Apple,Westlake University,Chinese University of Hong Kong (CUHK), βασισμένο σε China, μία οργάνωση κατηγοριοποιημένη ως academia,Industry,Academia,Academia.

06

DITTO— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε June 2022. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

07

DITTO— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation, Text summarization. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 25 May 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.