Dexterous In-Hand Manipulation [control policy]

Κλειστές βαρύτητες OpenAI 3.2M παράμετροι August 2018

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
OpenAI
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
1 August 2018
Συγγραφείς
Marcin Andrychowicz, Bowen Baker, Maciek Chociej, Rafal Jozefowicz, Bob McGrew, Jakub Pachocki, Arthur Petron, Matthias Plappert, Glenn Powell, Alex Ray, Jonas Schneider, Szymon Sidor, Josh Tobin, Peter Welinder, Lilian Weng, Wojciech Zaremba

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Robotics
Εργασία
Robotic manipulation

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
3.2M

See Figure 2 - Deployed model (D) consists of a Control Policy Network (B) and Vision Network (C), trained separately. (Training of (B) also includes training of a Value Network that is, ignoring input-output size differences, identical in architecture to that of the control policy; the value network is not included during deployment). Control Policy Network: 3181588 (23552 + 3147776 + 10260) see Table 2, Figure 12, Table 10 given: - input: 22 out [Table 2, 15+3+4] - normalization: 22 out - FC-…

Δεδομένα εκπαίδευσης
tokens

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
2.2 × 10²⁰ FLOP

In experiments, runs were typically conducted for 50 hours of wall time, with up to 32 GPUs. Table 10 specifies V100 GPUs for training the policy. Assume V100 base variant, BF16, 0.3 utilization V100 tensor FP16 performance = 1.25e14 FLOP/s 32 GPUs * (0.3 * 1.25e14 FLOP/s/GPU) * (3600 s/1 hr) * 50 hr = 2.16e+20 FLOP

Πώς ιδρύθηκε
Hardware

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA V100
χρησιμοποιούμενα τσιπ
8
Χρόνος τοίχου
50 hours
Κατανάλωση ενέργειας
5.0 kW

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
2,156

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Learning Dexterous In-Hand Manipulation
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

Dexterous In-Hand Manipulation [control policy] δημοσιεύθηκε από OpenAI, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια August 2018. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι industry.

Λειτουργεί στον τομέα της Robotics, και καταγράφεται ότι εκτελεί την εργασία του robotic manipulation.

Αυτό είναι ένα κλειστό μοντέλο: οι εκπαιδευμένες τιμές παρέμειναν με όποιον τις παρήγαγε, και δεν υπάρχει τοπική έκδοση για να τρέξει.

Εκπαίδευση και προελεύσεις

Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 2.2 × 10²⁰ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Απαντήσεις

Dexterous In-Hand Manipulation [control policy] — κοινές ερωτήσεις

01

Dexterous In-Hand Manipulation [control policy]— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 2.2 × 10²⁰ FLOP, σε υλικό καταγεγραμμένο ως NVIDIA V100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

02

Dexterous In-Hand Manipulation [control policy]— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

Dexterous In-Hand Manipulation [control policy]— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

04

Dexterous In-Hand Manipulation [control policy]— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 3.2M. See Figure 2 - Deployed model (D) consists of a Control Policy Network (B) and Vision Network (C), trained separately. (Training of (B) also includes training of a Value Network that is, ignoring input-output size differences, identical in architecture to that of the control policy; the value network is not included during deployment). Control Policy Network: 3181588 (23552 + 3147776 + 10260) see Table 2, Figure 12, Table 10 given: - input: 22 out [Table 2, 15+3+4] - normalization: 22 out - FC-RELU: 1024 out [Table 10, assume bias] - LSTM: 512 out [Table 10, assume bias] - FC (implied?): 20 out [Appendix C.1, Actions] parameters: - FC-RELU: 23552 [(22+1)*1024] - normalization: 0 [ignored] - LSTM: 3147776 [4*(1024+512+1)*512] - FC (Implied?): 10260 [(512+1)*20]. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

Dexterous In-Hand Manipulation [control policy]— ποιος το δημιούργησε;

Δημοσιεύθηκε από OpenAI, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

06

Dexterous In-Hand Manipulation [control policy]— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε August 2018. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

07

Dexterous In-Hand Manipulation [control policy]— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Robotics, και καταγράφεται ως διαχείριση της εργασίας του robotic manipulation. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 25 May 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.