AFM-server

Κλειστές βαρύτητες Apple July 2024

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Apple
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
29 July 2024
Συγγραφείς
Andy Narayanan, Aonan Zhang, Bowen Zhang, Chen Chen, Chong Wang, Chung-Cheng Chiu, David Qiu, Deepak Gopinath, Dian Ang Yap, Dong Yin, Feng Nan, Floris Weers, Guoli Yin, Haoshuo Huang, Jianyu Wang, Jiarui Lu, John Peebles, Ke Ye, Mark Lee, Nan Du, Qibin Chen, Quentin Keunebroek, Ruoming Pang, Sam Wiseman, Syd Evans, Tao Lei, Tom Gunter, Vivek Rathod, Xiang Kong, Xianzhi Du, Yanghao Li, Yongqiang W…

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Language modeling/generation
Προσέγγιση
Self-supervised learning
Αριθμητική μορφή
BF16

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

Δεδομένα εκπαίδευσης
7,400,000,000,000 tokens

Not explicitly mentioned, but I assume the 7.4T tokens do not involve multiple epochs.

Εποχές
1
Μέγεθος παρτίδας
18,949,753

Main pretraining uses sequence length of 4096 tokens; 4096 sequences per batch. During the "continued" pre-training stage, sequence length is upped to 8192 while batch size remains 4096. During context lengthening, sequence length is upped to 32768 while "the recipe is similar to that used for continued pre-training" implies same batch size of 4096. Weighting batch sizes by number of tokens seen in each stage: exp((6.3T * ln(4096 * 4096) + 1T * ln(8192 * 4096) + 100B * ln(32768 * 4096))/ 7.4T)…

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
4.3 × 10²⁴ FLOP

"The AFM base models are dense decoder-only models that build on the Transformer architecture" "We train AFM-server from scratch for 6.3T tokens on 8192 TPUv4 chips, using a sequence length of 4096 and a batch-size of 4096 sequences." "For both models we perform continued pre-training at a sequence length of 8192, with another 1T tokens from a mixture that upweights math and code, and down-weights the bulk web-crawl." "The sustained model-flop-utilization (MFU) for this training run was appro…

Πώς ιδρύθηκε
Operation counting,Hardware

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
Google TPU v4
χρησιμοποιούμενα τσιπ
8,192
Χρήση υλικού
MFU 52.0%

"AFM-server was trained on 8192 TPUv4 chips provisioned as 8 × 1024 chip slices, where slices are connected together by the data-center network (DCN) [Chowdhery et al., 2022]. Only data-parallelism crosses the slice boundary, other types of state sharding are within-slice only as the within-slice interconnect bandwidth is orders of magnitude higher than the DCN. The sustained model-flop-utilization (MFU) for this training run was approximately 52%."

Κατανάλωση ενέργειας
5.5 MW
Προμηθευτής νέφους
Google Cloud
Κέντρο δεδομένων
Google us-central2-b

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Hosted access (no API)
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Πιθανώς πάνω από 10²³ FLOP
Yes
Γιατί παρακολουθείται
Significant use

Currently in beta access only, but will be integrated into millions or billions of iPhones.

Εγγραφή εμπιστοσύνης
Likely

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Apple Intelligence Foundation Language Models
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

AFM-server δημοσιεύθηκε από Apple, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια July 2024. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του language modeling/generation.

Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.

Εκπαίδευση και προελεύσεις

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 4.3 × 10²⁴ FLOP, σε υλικό καταγεγραμμένο ως Google TPU v4. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Η εκπαίδευση κατανάλωσε ένα σύνολο περίπου 7,400,000,000,000 κωδικοί κειμένου

Το κριτήριο συμπερασμού του: significant use.

Απαντήσεις

AFM-server — κοινές ερωτήσεις

01

AFM-server— ποιος το δημιούργησε;

Δημοσιεύθηκε από Apple, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

02

AFM-server— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε July 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

03

AFM-server— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του language modeling/generation. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

04

AFM-server— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 4.3 × 10²⁴ FLOP, σε υλικό καταγεγραμμένο ως Google TPU v4. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

05

AFM-server— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

06

AFM-server— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

07

AFM-server— πόσες παραμέτρους έχει;

Δεν έχει δημοσιευθεί αριθμός παραμέτρων γι' αυτό, γι' αυτό και δεν εμφανίζεται καμία τιμή μνήμης ή ταχύτητας σε αυτή τη σελίδα.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.