$\infty$-former (SM)
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Universidade de Lisboa (ULisboa),DeepMind
- Τύπος οργανισμού
- Academia,Industry
- Χώρα
- Portugal, United Kingdom of Great Britain and Northern Ireland
- Δημοσιευμένο
- 1 September 2021
- Συγγραφείς
- Pedro Henrique Martins, Zita Marinho, André F. T. Martins
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling/generation
- Βασικό μοντέλο
- GPT-2 (124M)
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 124M
- Δεδομένα εκπαίδευσης
- 200,000,000 tokens
- Εποχές
- 1
assuming same as the base model GPT-2 small
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 1.2 × 10²² FLOP
- Πώς ιδρύθηκε
- Operation counting
- Ρύθμιση υπολογιστών
- 1.5 × 10¹⁷ FLOP
7.936 × 10^20 FLOP [base model compute estimation, "Speculative" confidence] + 1.488e+17 FLOP [fine-tune compute] = 7.937488e+20 FLOP
"To understand if long-term memories can be used to extend a pre-trained language model, we fine-tune GPT-2 small (Radford et al., 2019) on Wikitext103 (Merity et al., 2017) and a subset of PG-19 (Rae et al., 2019) containing the first 2,000 books (≈ 200 million tokens) of the training set" 6 FLOP / token / parameter * 124000000 parameters * 200000000 tokens * 1 epoch = 1.488e+17 FLOP
Η εκπαίδευση run
Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.
- Υλικό εκπαίδευσης
- NVIDIA GeForce RTX 2080 Ti 11GB
- χρησιμοποιούμενα τσιπ
- 1
- Κατανάλωση ενέργειας
- 277 W
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Open (non-commercial)
fine-tune code (this is a GPT-2 finetune), no clear license: https://github.com/deep-spin/infinite-former
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Εγγραφή εμπιστοσύνης
- Speculative
- Παραπομπές
- 31
- Δεδομένα αναφοράς
- $\infty$-former (SM)
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- $\infty$-former: Infinite Memory Transformer
- Τελευταία ενημέρωση
- 11 February 2026
Τι σημαίνουν οι αριθμοί
Υπόβαθρο
$\infty$-former (SM) δημοσιεύθηκε από Universidade de Lisboa (ULisboa),DeepMind, στην χώρα καταγεγραμμένη ως Portugal, κατά τη διάρκεια September 2021. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι academia,Industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation.
Το σημείο εκκίνησής του ήταν ένα υπάρχον μοντέλο βάσης, GPT-2 (124M). Αυτή είναι η συνηθισμένη διαδικασία παραγωγής ενός εξειδικευμένου μοντέλου.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Τι χρειάστηκε για την κατασκευή του
Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 1.2 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA GeForce RTX 2080 Ti 11GB. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 200,000,000 κωδικοί κειμένου
Απαντήσεις
$\infty$-former (SM) — κοινές ερωτήσεις
$\infty$-former (SM)— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 124M. assuming same as the base model GPT-2 small. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
$\infty$-former (SM)— ποιος το δημιούργησε;
Δημοσιεύθηκε από Universidade de Lisboa (ULisboa),DeepMind, βασισμένο σε Portugal, μία οργάνωση κατηγοριοποιημένη ως academia,Industry.
$\infty$-former (SM)— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε September 2021. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
$\infty$-former (SM)— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.
$\infty$-former (SM)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 1.2 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA GeForce RTX 2080 Ti 11GB. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
$\infty$-former (SM)— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
$\infty$-former (SM)— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.