ChatBit

Κλειστές βαρύτητες Beijing Institute of Technology,Academy of Military Science,Minzu University of China 13B παράμετροι June 2024

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Beijing Institute of Technology,Academy of Military Science,Minzu University of China
Τύπος οργανισμού
Academia,Government,Academia
Χώρα
China
Δημοσιευμένο
28 June 2024
Συγγραφείς
Zhang Huaping, Li Chunjin, Wei Shunping, Geng Guotong, Li Weiwei, Li Yugang

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Language
Εργασία
Chat, Language modeling/generation
Βασικό μοντέλο
LLaMA-13B

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
13B

Assuming as in LLaMA-13 since it is its finetune

Δεδομένα εκπαίδευσης
100,000,000 tokens

"researchers noted that its model incorporated only 100,000 military dialogue records, a relatively small number compared with other LLMs." "其他设置:训练的epoch为3,最大长度 max_length为2 048,batch_size为8,使用8个 A100 GPU训练,梯度积累为4,warm_up为训 练总步数的10%,采用AdamW优化器, 1 = 0.90、 2 = 0.95,学习率为1e-5" which is translated as "Other settings: 3 epochs for training, max_length of 2 048, batch_size of 8, 8 A100 GPUs for training, gradient accumulation of 4, warm_up of 10% of the total number of training steps, AdamW optim…

Εποχές
3
Μέγεθος παρτίδας
16,384

max_length of 2 048, batch_size of 8

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Πώς ιδρύθηκε
Operation counting
Ρύθμιση υπολογιστών
2.3 × 10¹⁹ FLOP

6ND = 6*13*10^9*100000000*3 = 2.34e+19

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA A100
χρησιμοποιούμενα τσιπ
8
Κατανάλωση ενέργειας
6.3 kW

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased
Κωδικός εκπαίδευσης
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Likely

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Large language model-driven open-source intelligence cognition
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

ChatBit δημοσιεύθηκε από Beijing Institute of Technology,Academy of Military Science,Minzu University of China, στην χώρα καταγεγραμμένη ως China, κατά τη διάρκεια June 2024. Η κατηγορία στην οποία υπάγεται ο εκδότης είναι academia,Government,Academia.

Λειτουργεί στον τομέα της Language, και καταγράφεται ότι εκτελεί την εργασία του chat, Language modeling/generation.

Αντί να εκπαιδευτεί από την αρχή, προέρχεται από LLaMA-13B. Αυτή είναι η συνηθισμένη διαδικασία παραγωγής ενός εξειδικευμένου μοντέλου.

Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.

Τι χρειάστηκε για την κατασκευή του

Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 100,000,000 κωδικοί κειμένου

Απαντήσεις

ChatBit — κοινές ερωτήσεις

01

ChatBit— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε June 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

02

ChatBit— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Language, και καταγράφεται ως διαχείριση της εργασίας του chat, Language modeling/generation. Αυτές είναι οι περιοχές γύρω από τις οποίες σχεδιάστηκε; Περιγράφουν την πρόθεση παρά ένα αυστηρό όριο.

03

ChatBit— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

04

ChatBit— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

05

ChatBit— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 13B. Assuming as in LLaMA-13 since it is its finetune. Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

06

ChatBit— ποιος το δημιούργησε;

Δημοσιεύθηκε από Beijing Institute of Technology,Academy of Military Science,Minzu University of China, βασισμένο σε China, μία οργάνωση κατηγοριοποιημένη ως academia,Government,Academia.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.