FTW (For The Win)

Κλειστές βαρύτητες DeepMind 126M παράμετροι July 2018

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
DeepMind
Τύπος οργανισμού
Industry
Χώρα
United Kingdom of Great Britain and Northern Ireland
Δημοσιευμένο
3 July 2018
Συγγραφείς
Max Jaderberg, Wojciech M. Czarnecki, Iain Dunning, Luke Marris, Guy Lever, Antonio Garcia Castaneda, Charles Beattie, Neil C. Rabinowitz, Ari S. Morcos, Avraham Ruderman, Nicolas Sonnerat, Tim Green, Louise Deason, Joel Z. Leibo, David Silver, Demis Hassabis, Koray Kavukcuoglu, Thore Graepel

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Games
Εργασία
Capture the flag
Προσέγγιση
Self-supervised learning

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
126M

Architecture described in figure S11 of the supplement The architecture includes modules for visual embedding, reward prediction, recurrent processing, policy, baseline and pixel control. Input is 84x84x3 pixels as seen in figure S10 of the supplement "We elected to use a resolution of 84x84 pixels as in previous related work in this environment. Each pixel is represented by a triple of three bytes" Visual embedding (84x84x3 -> 256) 32*(8*8*3+1)+64*(4*4*32+1)+64*(3*3*64+1)+64*(3*3*64+1) + (8…

Δεδομένα εκπαίδευσης
2,000,000,000 tokens

Agents were trained for two billion steps, corresponding to approximately 450K games.

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
3.5 × 10¹⁹ FLOP

Source: https://docs.google.com/spreadsheets/d/1Kj4Q5WADcDXtUJLIOfGTCE3tGvxNczEMwyy8QtgSkHk/edit#gid=54587040&fvid=1361937389 Additional estimate based on parameters (low confidence, had to make some assumptions about the architecture) Forward pass operations Vision 84*84*32*8*8*3+20*20*32*64*4*4+7*7*64*64*3*3+7*7*64*64*3*3+7*7*64*256=60874752 60874752*2=121749504 Pixel control (guess on the internal dimensions) 256*32*7*7+7*7*32*32*9*9+20*20*32*4*4*(1+2+3+4+5)=7537664 Remaining 2*(463616+331…

Πώς ιδρύθηκε
Third-party estimation

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Γιατί παρακολουθείται
SOTA improvement

"In this work, we demonstrate for the first time that an agent can achieve human-level in a popular 3D multiplayer first-person video game, Quake III Arena Capture the Flag (28), using only pixels and game points as input."

Εγγραφή εμπιστοσύνης
Speculative
Παραπομπές
802

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Human-level performance in first-person multiplayer games with population-based deep reinforcement learning
Τελευταία ενημέρωση
25 May 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

FTW (For The Win) δημοσιεύθηκε από DeepMind, στην χώρα καταγεγραμμένη ως United Kingdom of Great Britain and Northern Ireland, κατά τη διάρκεια July 2018. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.

Λειτουργεί στον τομέα της Games, και καταγράφεται ότι εκτελεί την εργασία του capture the flag.

Τα βάρη του δεν έχουν δημοσιευθεί ποτέ, οπότε μπορεί να προσεγγιστεί μόνο μέσω του παρόχου του. Καμία κάρτα γραφικών δεν αλλάζει αυτό.

Εκπαίδευση και προελεύσεις

Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 3.5 × 10¹⁹ FLOP. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 2,000,000,000 κωδικοί κειμένου

Ο λόγος που εμφανίζεται σε αυτόν τον κατάλογο είναι: sOTA improvement.

Απαντήσεις

FTW (For The Win) — κοινές ερωτήσεις

01

FTW (For The Win)— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 3.5 × 10¹⁹ FLOP. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

02

FTW (For The Win)— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

FTW (For The Win)— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

04

FTW (For The Win)— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 126M. Architecture described in figure S11 of the supplement The architecture includes modules for visual embedding, reward prediction, recurrent processing, policy, baseline and pixel control. Input is 84x84x3 pixels as seen in figure S10 of the supplement "We elected to use a resolution of 84x84 pixels as in previous related work in this environment. Each pixel is represented by a triple of three bytes" Visual embedding (84x84x3 -> 256) 32*(8*8*3+1)+64*(4*4*32+1)+64*(3*3*64+1)+64*(3*3*64+1) + (84/(S^4)*84/(S^4)*64+1)*256 Note there is no information about the stride S used in the convolutions; we assume S = 1 Reward prediction (256 -> 3) (256+1)*128 + (128+1)*3 Recurrent processing (n-> 512) VU1 (256 -> 512) 4*(799+2*32)*((512+(32*2) + 3*32 + 5*2 + 3)+(799+2*32)+1) + 2*(256+1)*256 VU2 (512 -> 512) 4*(512+2*32)*((512+(32*2) + 3*32 + 5*2 + 3)+(512+2*32)+1) + 2*(256+1)*256 LSTMs usually have 4*(n*m+n*n+n) parameters, where n=input size and m=output size. This DNS + LSTM takes as input the concatenation of the previous layer of size n and R read vectors of size W=32; and outputs m units plus an interface vector of size (W*R) + 3*W + 5*R + 3, for a total of about 4*(n+R*W)*((m+(W*R) + 3*W + 5*R + 3)+(n+R*32)+1) parameters I assume R=2 since that seems implied by the previous paper (?) The first VU has as input the visual embedding (size 256), the previous action (size 540) and the previous reward (size 3), for a total size of 256+540+3 = 799. The output is size 512. The second VU has input size 512 and output size 512 The DNC memory architecture is described in https://www.nature.com/articles/nature20101.epdf Policy (512 -> 5x3x3x3x2x2) 6*(512+1)*256 + (256+1)*5 + 3*(256+1)*3 + 2*(256+1)*2 Baseline (512+1)*256 + (256+1)*1 Pixel control (512+1)*32*7*7 + 32*(9*9+1) + 5*(4*4+1) + 3*2*(4*4+1) + 2*2*(4*4+1) + 1*(4*4+1) "we trained independent pixel control policies for each of the six action groups". Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

FTW (For The Win)— ποιος το δημιούργησε;

Δημοσιεύθηκε από DeepMind, βασισμένο σε United Kingdom of Great Britain and Northern Ireland, μία οργάνωση κατηγοριοποιημένη ως industry.

06

FTW (For The Win)— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε July 2018. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

07

FTW (For The Win)— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Games, και καταγράφεται ως διαχείριση της εργασίας του capture the flag. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 25 May 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.