RL mapping instructions (troubleshooting)

Κλειστές βαρύτητες Massachusetts Institute of Technology (MIT) 133.1K παράμετροι August 2009

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Massachusetts Institute of Technology (MIT)
Τύπος οργανισμού
Academia
Χώρα
United States of America
Δημοσιευμένο
2 August 2009
Συγγραφείς
SRK Branavan, H Chen, LS Zettlemoyer, R Barzilay

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Instruction interpretation

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
133.1K

"We use a policy gradient algorithm to estimate the parameters of a log-linear model for action selection [...] In total, there are 4,438 features [in the Windows domain]. [...] This difficulty can be attributed in part to the large branching factor of possible actions at each step — on average, there are 27.14 choices per action in the Windows domain"

Δεδομένα εκπαίδευσης
tokens

Shown at beginning of section 7 Total number of documents is 128, average number of actions per document is 10.37

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Παραπομπές
318

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Reinforcement Learning for Mapping Instructions to Actions
Τελευταία ενημέρωση
11 February 2026

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

RL mapping instructions (troubleshooting) δημοσιεύθηκε από Massachusetts Institute of Technology (MIT), στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια August 2009. Προέρχεται από έναν οργανισμό που κατατάσσεται ως academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του instruction interpretation.

Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.

Απαντήσεις

RL mapping instructions (troubleshooting) — κοινές ερωτήσεις

01

RL mapping instructions (troubleshooting)— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του instruction interpretation. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.

02

RL mapping instructions (troubleshooting)— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

RL mapping instructions (troubleshooting)— είναι ανοιχτού κώδικα;

Η αδειοδότηση δεν καταγράφηκε ποτέ στα πηγά μας δεδομένα. Αντιμετωπίζουμε τις μη δηλωμένες άδειες ως κλειστές, επειδή μια μη καταγεγραμμένη άδεια δεν είναι μία στην οποία μπορείς να βασιστείς.

04

RL mapping instructions (troubleshooting)— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 133.1K. "We use a policy gradient algorithm to estimate the parameters of a log-linear model for action selection [...] In total, there are 4,438 features [in the Windows domain]. [...] This difficulty can be attributed in part to the large branching factor of possible actions at each step — on average, there are 27.14 choices per action in the Windows domain". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

RL mapping instructions (troubleshooting)— ποιος το δημιούργησε;

Δημοσιεύθηκε από Massachusetts Institute of Technology (MIT), βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως academia.

06

RL mapping instructions (troubleshooting)— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε August 2009. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 11 February 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.