OmniParser: Icon Description Model

Ανοιχτά βάρη Microsoft Research August 2024

Καμία εκτίμηση

Δεν υπάρχουν απαιτήσεις υλικού για αυτό το μοντέλο

Τα βάρη αυτού του μοντέλου είναι OPEN, αλλά κανένας αριθμός παραμέτρων δεν έχει δημοσιευθεί γι' αυτό. Κάθε FIGURE μνήμης και ταχύτητας ξεκινά από αυτόν τον αριθμό, οπότε θα προτιμούσαμε να μην δείξουμε τίποτα παρά μια κατασκευασμένη εκτίμηση..

Σε καταγραφή

Πλήρης προδιαγραφή

Όλα τα καταγεγραμμένα για αυτό το μοντέλο. Τα περισσότερα από αυτά περιγράφουν το πώς εκπαιδεύτηκε παρά το πώς τρέχει — χρήσιμο πλαίσιο για την εκτίμηση του πόση εργασία έχει επενδυθεί σε αυτό, και πώς συγκρίνεται με μοντέλα που έχουν κατασκευαστεί σε διαφορετική κλίμακα..

Προέλευση

Ποιος κατασκεύασε αυτό το μοντέλο, πού και πότε δημοσιεύθηκε.

Οργάνωση
Microsoft Research
Τύπος οργανισμού
Industry
Χώρα
United States of America
Δημοσιευμένο
1 August 2024
Συγγραφείς
Yadong Lu, Jianwei Yang, Yelong Shen, Ahmed Awadallah

Τι κάνει

Οι προβληματικές περιοχές για τις οποίες σχεδιάστηκε το μοντέλο. Ένα μοντέλο μπορεί να διαθέτει αρκετές από κάθε μία.

τομέας
Vision
Εργασία
Image captioning
Βασικό μοντέλο
BLIP-2 (Q-Former)

Μέγεθος

Πόσο μεγάλο είναι το μοντέλο και πόσα δεδομένα έχει εκπαιδευτεί. Οι παράμετροι είναι ο αριθμός που αποφασίζει αν χωράει σε μια δεδομένη κάρτα γραφικών.

Δεδομένα εκπαίδευσης
tokens

"We finetune BLIP-2 model for 1 epoch on the generated dataset with constant learning rate of 1e−5 ,no weight decay and Adam optimizer. " "We we curate a dataset of 7k icon-description pairs using GPT-4o, and finetune a BLIP-v2 model [LLSH23] on this dataset" "we collected 7185 icon-description pairs for finetuning"

Εποχές
1

Διαθεσιμότητα

Εάν μπορείτε να αποκτήσετε το μοντέλο και να το τρέξετε στο δικό σας υλικό, το οποίο αποφασίζει αν οποιαδήποτε από τις αριθμούς της κάρτας γραφικών σε αυτή τη σελίδα ισχύει.

Βάρη
Open — downloadable
Πρόσβαση μοντέλου
Open weights (unrestricted)

Πώς ταξινομείται

Ετικέτες το πηγαίο σύνολο δεδομένων εφαρμόζει όταν παρακολουθεί σημαντικά μοντέλα, και πόσο βέβαιο είναι στην είσοδο.

Εγγραφή εμπιστοσύνης
Confident

Πηγές

Από πού προήλθε αυτή η καταγραφή και πότε ελέγχθηκε τελευταία φορά.

Αναφορά
OmniParser for Pure Vision Based GUI Agent
Τελευταία ενημέρωση
28 November 2025

Τι σημαίνουν οι αριθμοί

Τι είναι αυτό το μοντέλο

OmniParser: Icon Description Model δημοσιεύθηκε από Microsoft Research, στην χώρα καταγεγραμμένη ως United States of America, κατά τη διάρκεια August 2024. Ο εκδοτικός οργανισμός κατηγοριοποιείται ως industry.

Λειτουργεί στον τομέα της Vision, και καταγράφεται ότι εκτελεί την εργασία του image captioning.

Το σημείο εκκίνησής του ήταν ένα υπάρχον μοντέλο βάσης, BLIP-2 (Q-Former). Αυτή είναι η συνηθισμένη διαδικασία παραγωγής ενός εξειδικευμένου μοντέλου.

Τα ανοιχτά βάρη είναι αυτά που τοποθετούν αυτή τη σελίδα στον υπολογιστή αντί να είναι μόνο στον κατάλογο: είναι ένα μοντέλο που μπορείς να κρατήσεις πραγματικά.

Απαντήσεις

OmniParser: Icon Description Model — κοινές ερωτήσεις

01

OmniParser: Icon Description Model— ποια GPU χρειάζομαι για να το τρέξω;

Δεν μπορούμε να πούμε. Έχει OPEN WEIGHTS, αλλά δεν έχει δημοσιευτεί καμία μέτρηση παραμέτρων για αυτό, και όλοι οι υπολογισμοί ΜΝΗΜΗΣ και ταχύτητας ξεκινούν από αυτόν τον αριθμό. Θα προτιμούσαμε να μην δείξουμε τίποτα από το να δώσουμε μια κατασκευασμένη εκτίμηση.

02

OmniParser: Icon Description Model— είναι ανοιχτού κώδικα;

Οι βάσεις του είναι δημοσιευμένες, οπότε μπορεί να κατέβει και να τρέξει σε δικό σας υλικό. Σημειώστε ότι τα open weights δεν είναι το ίδιο με το open source με την πλήρη έννοια — δεν λέει τίποτα για τα δεδομένα εκπαίδευσης, τον κώδικα εκπαίδευσης ή τους εμπορικούς όρους που συσχετίζονται.

03

OmniParser: Icon Description Model— πόσες παραμέτρους έχει;

Δεν έχει δημοσιευθεί αριθμός παραμέτρων γι' αυτό, γι' αυτό και δεν εμφανίζεται καμία τιμή μνήμης ή ταχύτητας σε αυτή τη σελίδα.

04

OmniParser: Icon Description Model— ποιος το δημιούργησε;

Δημοσιεύθηκε από Microsoft Research, βασισμένο σε United States of America, μία οργάνωση κατηγοριοποιημένη ως industry.

05

OmniParser: Icon Description Model— πότε κυκλοφόρησε;

Δημοσιεύθηκε σε August 2024. Η ικανότητα ανά παράμετρο έχει βελτιωθεί σημαντικά από τότε, οπότε ένα νέο ΜΟΝΤΕΛ του ίδιου μεγέθους είναι συχνά η καλύτερη χρήση του ίδιου υλικού.

06

OmniParser: Icon Description Model— για τί χρησιμοποιείται;

Λειτουργεί στον τομέα της Vision, και καταγράφεται ως διαχείριση της εργασίας του image captioning. Τα Μοντέλα συχνά φέρουν περισσότερα από ένα από το καθένα, και οι ετικέτες περιγράφουν τον σκοπό παρά τους περιορισμούς ικανότητας.

07

OmniParser: Icon Description Model— πού μπορώ να το κατεβάσω;

Οι παράμετροι είναι δημοσιευμένες, αν και δεν κρατάμε σύνδεσμο αποθετηρίου γι' αυτό. Αυτή η ιστοσελίδα υπολογίζει τις απαιτήσεις υλικού αντί να φιλοξενεί αρχεία μοντέλων.

Πηγή

Αρχική δημοσίευση

Η καταγραφή ενημερώθηκε τελευταία φορά 28 November 2025

Η άλλη κατεύθυνση

Κοιτάζοντας το από την άλλη πλευρά;

Αυτή η σελίδα ξεκινά από το μοντέλο. Αν έχετε ήδη μια κάρτα και θέλετε να μάθετε τα πάντα για το τι θα τρέξει., ξεκινήστε από το υλικό αντ' αυτού.