MosaicML Diffusion

Κλειστές βαρύτητες Databricks 1.3B παράμετροι April 2023

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Δεν έχει δημοσιευτεί το βάρος για αυτό το μοντέλο, επομένως δεν μπορεί να κατέβει ή να τρέξει σε δικό σας υλικό σε οποιοδήποτε μέγεθος. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του, και καμία κάρτα γραφικών δεν το αλλάζει αυτό..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Databricks
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
28 April 2023
Συγγραφείς
Mihir Patel, Erica Ji Yuen, Cory Stephenson, Landan Seguin

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Image generation
Εργασία
Image generation, Text-to-image
Προσέγγιση
Self-supervised learning

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

παράμετροι
1.3B

Manually loaded model with following code snippet: from diffusers import DiffusionPipeline, DPMSolverMultistepScheduler import torch repo_id = "stabilityai/stable-diffusion-2" pipe = DiffusionPipeline.from_pretrained(repo_id, torch_dtype=torch.float16, revision="fp16") n_params_vae = sum(p.numel() for p in pipe.components['vae'].parameters()) n_params_text_encoder = sum(p.numel() for p in pipe.components['text_encoder'].parameters()) n_params_unet = sum(p.numel() for p in pipe.components['une…

Δεδομένα εκπαίδευσης
790,000,000 tokens

For the first phase of training, we used all images with resolution >=256x256, amounting to 790 million image-caption samples. For the second phase of training, we only used images with resolution >=512x512, amounting to 300 million image-caption samples. Note that second phase data is a strict subset of first stage.

Εποχές
1.38

Εκπαίδευση υπολογιστών

Η αριθμητική που πραγματοποιήθηκε για την εκπαίδευση του μοντέλου, μετρημένη σε πράξεις κινητής υποδιαστολής. Είναι ένα μέτρο του κόστους της προπόνησης, όχι της ταχύτητας με την οποία το ολοκληρωμένο μοντέλο σας απαντά.

Εκπαίδευση υπολογιστών
1.1 × 10²² FLOP

23,835 A100-hours * 3.12e14 FLOP/GPU-sec * 3600 sec/hour * 0.4 (assumed utilization) = 1.07e22 "Both phases of training ran on 128 NVIDIA A100 GPUs. The first training phase was run for 550k iterations in 1.6 days while the second phase was run for 850k iterations in 4.9 days, for a total of 20,051 A100 hours for training. In addition to the training time, we pre-computed the latents for the VAE and CLIP model to reduce training time and cost when making multiple passes over the dataset. Pre-co…

Πώς ιδρύθηκε
Hardware

Η εκπαίδευση run

Τι απαιτήθηκε φυσικά για την εκπαίδευση: ποιες κάρτες, πόσες, για πόσο καιρό, και τι αυτό απαιτούσε από το ρεύμα.

Υλικό εκπαίδευσης
NVIDIA A100
χρησιμοποιούμενα τσιπ
128
Χρόνος τοίχου
186 hours (7.8 days)

"Both phases of training ran on 128 NVIDIA A100 GPUs. The first training phase was run for 550k iterations in 1.6 days while the second phase was run for 850k iterations in 4.9 days, for a total of 20,051 A100 hours for training. In addition to the training time, we pre-computed the latents for the VAE and CLIP model to reduce training time and cost when making multiple passes over the dataset. Pre-computing the latents required an additional 3,784 A100 hours, resulting in 23,835 A100 hours in t…

Κατανάλωση ενέργειας
102.0 kW

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Closed — provider access only
Πρόσβαση μοντέλου
Unreleased

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Confident

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
Training Stable Diffusion from Scratch for <$50k with MosaicML
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Σχετικά με αυτό το μοντέλο

MosaicML Diffusion δημοσιεύθηκε από Databricks, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια April 2023. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.

Λειτουργεί στον τομέα της Image generation, και καταγράφεται ότι εκτελεί την εργασία του image generation, Text-to-image.

Επειδή τα WEIGHTS δεν είναι διαθέσιμα, κανένα από τα figures του HARDWARE αλλού σε αυτό το SITE δεν ισχύει γι' αυτό.

Τι χρειάστηκε για την κατασκευή του

Η εκπαίδευση απαιτούσε έναν υπολογιστικό προϋπολογισμό περίπου 1.1 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A100. Αυτή η τιμή μετράει το κόστος παραγωγής του μοντέλου και δεν έχει σχέση με το πόσο γρήγορα απαντά.

Το σύνολο εκπαίδευσης εκτελέστηκε σε περίπου 790,000,000 κωδικοί κειμένου

Απαντήσεις

MosaicML Diffusion — κοινές ερωτήσεις

01

MosaicML Diffusion— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε April 2023. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

02

MosaicML Diffusion— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Image generation, και καταγράφεται ως διαχείριση της εργασίας του image generation, Text-to-image. Ένα ΜΟΝΤΕΛ μπορεί να φέρει πολλά από το καθένα, οπότε αυτές είναι οι περιοχές για τις οποίες κατασκευάστηκε παρά περιορισμός σε ό,τι θα προσπαθήσει.

03

MosaicML Diffusion— πόσο υπολογιστική ισχύς χρησιμοποιήθηκε για την εκπαίδευσή του;

Η εκπαίδευση κατανάλωσε περίπου 1.1 × 10²² FLOP, σε υλικό καταγεγραμμένο ως NVIDIA A100. Αυτό μετράει το κόστος παραγωγής του μοντέλου και δεν λέει τίποτα για το πόσο γρήγορα απαντά μόλις εκπαιδευτεί — η ταχύτητα συμπερασμάτων προέρχεται από τον δίαυλο μνήμης, όχι από τον προϋπολογισμό εκπαίδευσης.

04

MosaicML Diffusion— ποια GPU χρειάζομαι για να το τρέξω;

Κανένα. Αυτό είναι ένα κλειστό μοντέλο - τα βάρη του δεν δημοσιεύθηκαν ποτέ, οπότε δεν μπορεί να κατέβει ή να εκτελεστεί σε δικό σας υλικό σε καμία τιμή. Είναι προσβάσιμο μόνο μέσω του προμηθευτή του.

05

MosaicML Diffusion— είναι ανοιχτού κώδικα;

Όχι. Τα βάρη του δεν έχουν δημοσιευθεί, οπότε υπάρχει μόνο ως υπηρεσία που ελέγχεται από τον ιδιοκτήτη του.

06

MosaicML Diffusion— πόσες παραμέτρους έχει;

Έχει αριθμό παραμέτρων 1.3B. Manually loaded model with following code snippet: from diffusers import DiffusionPipeline, DPMSolverMultistepScheduler import torch repo_id = "stabilityai/stable-diffusion-2" pipe = DiffusionPipeline.from_pretrained(repo_id, torch_dtype=torch.float16, revision="fp16") n_params_vae = sum(p.numel() for p in pipe.components['vae'].parameters()) n_params_text_encoder = sum(p.numel() for p in pipe.components['text_encoder'].parameters()) n_params_unet = sum(p.numel() for p in pipe.components['unet'].parameters()) n_params = n_params_vae + n_params_text_encoder + n_params_unet print(f"Total number of parameters: {n_params}"). Αυτή η φιγούρα είναι το σύνολο, και είναι αυτό που αποφασίζει πόση μνήμη χρειάζεται το μοντέλο - περίπου μισό γιγαμπάιτ ανά δισεκατομμύριο με τη συμπίεση που χρησιμοποιεί το πιο πολλοί άνθρωποι.

07

MosaicML Diffusion— ποιος το δημιούργησε;

Δημοσιεύθηκε από Databricks, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.