Base LM + kNN LM + Continuous Cache
Καμία εκτίμηση
Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο
Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..
Σε καταγραφή
Πλήρης προδιαγραφή
Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..
Προέλευση
Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.
- Οργάνωση
- Stanford University,Facebook AI Research
- Τύπος οργανισμού
- Academia,Industry
- Χώρα
- United States of America, France
- Δημοσιευμένο
- 1 November 2019
- Συγγραφείς
- Urvashi Khandelwal, Omer Levy, Dan Jurafsky, Luke Zettlemoyer, Mike Lewis
Τι κάνει
Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.
- τομέας
- Language
- Εργασία
- Language modeling
Μέγεθος
Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.
- παράμετροι
- 247M
- Δεδομένα εκπαίδευσης
- 103,000,000 tokens
- Εποχές
- 200
"we take the exact architecture and optimization described by Baevski & Auli (2019) and use it to create a kNN-LM for inference. This model consists of 16 layers, each with 16 self-attention heads, 1024 dimensional hidden states, and 4096 dimensional feedforward layers, amounting to 247M trainable parameters."
" During this forward pass, each target token is provided a minimum of 1536 tokens of prior context for WIKITEXT-103" 200 epochs - figure 8
Εκπαίδευση υπολογιστών
Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.
- Εκπαίδευση υπολογιστών
- 3.1 × 10¹⁹ FLOP
- Πώς ιδρύθηκε
- Operation counting
6 FLOP / parameter / token * 247*10^6 parameters * 103000000 tokens * 200 epochs = 3.05292e+19 FLOP __________ for the Algorithmic progress paper 7.3 × 10^18 FLOP was estimated similar to supposedly base model (transformer)
Διαθεσιμότητα
Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.
- Βάρη
- Closed — provider access only
- Πρόσβαση μοντέλου
- Unreleased
- Κωδικός εκπαίδευσης
- Open source
Training code, MIT: https://github.com/urvashik/knnlm
Πώς ταξινομείται
Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.
- Γιατί παρακολουθείται
- SOTA improvement
- Εγγραφή εμπιστοσύνης
- Likely
- Παραπομπές
- 1,049
- Δεδομένα αναφοράς
- Base LM + kNN LM + Continuous Cache
"GNN-LM achieves a new state-of-the-art perplexity of 14.8 on WikiText-103"
Πηγές
Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.
- Αναφορά
- Generalization through Memorization: Nearest Neighbor Language Models
- Τελευταία ενημέρωση
- 25 May 2026
Τι σημαίνουν οι αριθμοί
Τι είναι αυτό το μοντέλο
Base LM + kNN LM + Continuous Cache δημοσιεύθηκε από Stanford University,Facebook AI Research, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια November 2019. Προέρχεται από έναν οργανισμό που κατατάσσεται ως academia,Industry.
Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling.
Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.
Τι χρειάστηκε για την κατασκευή του
Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 3.1 × 10¹⁹ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.
Εκπαιδεύτηκε σε ένα σώμα περίπου 103,000,000 κωδικοί κειμένου
Ο λόγος που εμφανίζεται σε αυτόν τον κατάλογο είναι: sOTA improvement.
Απαντήσεις
Base LM + kNN LM + Continuous Cache — κοινές ερωτήσεις
Base LM + kNN LM + Continuous Cache— ποιος το δημιούργησε;
Δημοσιεύθηκε από Stanford University,Facebook AI Research, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως academia,Industry.
Base LM + kNN LM + Continuous Cache— πότε κυκλοφόρησε;
Δημοσιεύθηκε σε November 2019. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.
Base LM + kNN LM + Continuous Cache— για τί χρησιμοποιείται;
Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.
Base LM + kNN LM + Continuous Cache— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;
Η εκπαίδευση κατανάλωσε περίπου 3.1 × 10¹⁹ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.
Base LM + kNN LM + Continuous Cache— ποια GPU χρειάζομαι για να το τρέξω;
Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.
Base LM + kNN LM + Continuous Cache— είναι ανοιχτού κώδικα;
Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.
Base LM + kNN LM + Continuous Cache— πόσες παραμέτρους έχει;
Έχει αριθμό παραμέτρων 247M. "we take the exact architecture and optimization described by Baevski & Auli (2019) and use it to create a kNN-LM for inference. This model consists of 16 layers, each with 16 self-attention heads, 1024 dimensional hidden states, and 4096 dimensional feedforward layers, amounting to 247M trainable parameters.". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.
Η άλλη κατεύθυνση
Κοιτάζοντας το από την άλλη πλευρά;
Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.