PLAPT

Κλειστές βαρύτητες Wolfram Research,ASC27,Newport High School,Sanskriti School 1.5M παράμετροι February 2024

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Wolfram Research,ASC27,Newport High School,Sanskriti School
Τύπος οργανισμού
Industry,Industry,Academia
Χώρα
United States of America, Italy, India
Δημοσιευμένο
12 February 2024
Συγγραφείς
Tyler Rose, Nicolò Monti, Navvye Anand, Tianyu Shen

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Biology
Εργασία
Protein-ligand binding affinity prediction
Βασικό μοντέλο
ChemBERTa,ProtBERT-BFD

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
1.5M

"Figure 3: The prediction module takes a 1792x1 feature vector as its input, which is then partitioned into two streams: The first stream processes the first 1024 indices of the feature vector through a 512-node protein-specific linear layer, followed by a ReLU activation function. Concurrently, the second stream processes the latter 768 feature indices through a similar 512-node moleculespecific linear layer, also followed by a ReLU activation. Outputs from both streams are concatenated into a…

Δεδομένα εκπαίδευσης
tokens

Training set: 90,000 samples Tokens per sample: 3,200 (protein) + 278 (ligand) = 3,478 Total tokens = 90,000 × 3,478 = 313,020,000 (3.13e8) tokens

Εποχές
60

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
3.9 × 10²² FLOP

1474624 connections; 90,000 training examples; table a4 mentions 60 training rounds 6*1474624*90000*60=47777817600000 Including base models: 8465436600000000000 + 3.9e+22 + 47777817600000 = 39008465484377820000000

Πώς ιδρύθηκε
Operation counting

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA GeForce RTX 4060 Ti
χρησιμοποιούμενα τσιπ
1
Κατανάλωση ενέργειας
174 W

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Confident
Παραπομπές
8

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
PLAPT: Protein-Ligand Binding Affinity Prediction Using Pretrained Transformers
Τελευταία ενημέρωση
1 January 2026

Τι σημαίνουν οι αριθμοί

Από πού προήλθε

PLAPT δημοσιεύθηκε από Wolfram Research,ASC27,Newport High School,Sanskriti School, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια February 2024. Προέρχεται από έναν οργανισμό που κατατάσσεται ως industry,Industry,Academia.

Λειτουργεί στον τομέα της Biology, και καταγράφεται ότι εκτελεί την εργασία του protein-ligand binding affinity prediction.

Βασίζεται σε ChemBERTa,ProtBERT-BFD. Οι περισσότεροι μοντέλα σε αυτή την κλίμακα προσαρμόζονται από μια υπάρχουσα βάση παρά κατασκευάζονται από το μηδέν.

Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.

Πώς εκπαιδεύτηκε

Η παραγωγή του απαιτούσε αριθμητική που ανήλθε περίπου 3.9 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA GeForce RTX 4060 Ti. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Απαντήσεις

PLAPT — κοινές ερωτήσεις

01

PLAPT— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 3.9 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA GeForce RTX 4060 Ti. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

02

PLAPT— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

03

PLAPT— είναι ανοιχτού κώδικα;

Η αδειοδότηση δεν καταγράφηκε ποτέ στα πηγά μας δεδομένα. Αντιμετωπίζουμε τις μη δηλωμένες άδειες ως κλειστές, επειδή μια μη καταγεγραμμένη άδεια δεν είναι μία στην οποία μπορείς να βασιστείς.

04

PLAPT— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 1.5M. "Figure 3: The prediction module takes a 1792x1 feature vector as its input, which is then partitioned into two streams: The first stream processes the first 1024 indices of the feature vector through a 512-node protein-specific linear layer, followed by a ReLU activation function. Concurrently, the second stream processes the latter 768 feature indices through a similar 512-node moleculespecific linear layer, also followed by a ReLU activation. Outputs from both streams are concatenated into a single vector of 1024 elements. This combined vector is passed through a batch normalization layer with a momentum of 0.9 and epsilon of 0.001. The vector is then fed through the 512-node Linear Layer 1 and ReLU activation. A dropout layer with a probability of 20% is then applied to mitigate overfitting. Following the dropout layer, the prediction module continues to reduce the feature space with the 64-node Linear Layer 2 with ReLU activation, before reaching the single node Linear Layer 3. This layer outputs the predicted scalar value representing the normalized negative log10 affinity value, which is then un-normalized." (512 * 1024) + (512 * 768) + (512 * 1024) + (64 * 512) + 64 = 1474624. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

05

PLAPT— ποιος το δημιούργησε;

Δημοσιεύθηκε από Wolfram Research,ASC27,Newport High School,Sanskriti School, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry,Industry,Academia.

06

PLAPT— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε February 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

07

PLAPT— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Biology, και καταγράφεται ως διαχείριση της εργασίας του protein-ligand binding affinity prediction. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 1 January 2026

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.