MiniMax-Text-01 Calcolatore TPS
Ogni scheda sotto valutata rispetto a questo modello alla lunghezza di contesto e qualità minima da Lei scelta. La velocità è una stima per una singola richiesta, calcolata in base alla larghezza di banda della memoria della scheda e alla dimensione del modello una volta compresso.
Calcolato per questo modello
818 schede di cui abbiamo le specifiche
La scheda più piccola che si adatta
Radeon Instinct MI325X
256 GB · Q3_K_M · 11.7 tok/s
Scheda più veloce
B300
18.3 tok/s · 288 GB
Quali GPU possono eseguire MiniMax-Text-01?
Imposta gli input, leggi la risposta
Una conversazione più lunga richiede più memoria, il che può far sì che questo modello venga eliminato da schede di dimensioni minori.
Nasconde le schede che si adatterebbero solo al modello comprimendole al di sotto di questo punto.
4 schede corrispondenti
Calcolo| Necessità | Quantizzazione | Adatto | |||||
|---|---|---|---|---|---|---|---|
|
18.3
tok/s
11–29 · bassa fiducia |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 250.0 GB | IQ4_XS | Stretto |
|
14.6
tok/s
9–23 · bassa fiducia |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 250.0 GB | IQ4_XS | Stretto |
|
14.6
tok/s
9–23 · bassa fiducia |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 250.0 GB | IQ4_XS | Stretto |
|
11.7
tok/s
7–19 · bassa fiducia |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 223.5 GB | Q3_K_M | Stretto |
Le velocità sono stime per una singola richiesta — una conversazione alla volta — calcolate in base alla bandwidth della memoria, alle dimensioni del modello e alla quantizzazione. La reale capacità di throughput varia in base al runtime dell'inferenza e alla sua versione. Le cifre pubblicate dai fornitori di hardware misurano molte richieste contemporaneamente e sono molto più elevate.
In registrazione
Specifiche complete
Tutto ciò che riguarda questo modello. La maggior parte delle informazioni descrive come è stato addestrato piuttosto che come viene eseguito — un contesto utile per valutare la quantità di lavoro impiegata e come si confronta con modelli realizzati su scala diversa.
Origine
Chi ha costruito questo modello, dove e quando è stato pubblicato.
- Organizzazione
- MiniMax
- Tipo di organizzazione
- Industry
- Paese
- China
- Pubblicato
- 14 January 2025
- Autori
- MiniMax, Aonian Li, Bangwei Gong, Bo Yang, Boji Shan, Chang Liu, Cheng Zhu, Chunhao Zhang, Congchao Guo, Da Chen, Dong Li, Enwei Jiao, Gengxin Li, Guojun Zhang, Haohai Sun, Houze Dong, Jiadai Zhu, Jiaqi Zhuang, Jiayuan Song, Jin Zhu, Jingtao Han, Jingyang Li, Junbin Xie, Junhao Xu, Junjie Yan, Kaishun Zhang, Kecheng Xiao, Kexi Kang, Le Han, Leyang Wang, Lianfei Yu, Liheng Feng, Lin Zheng, Linbo Ch…
Cosa fa
Le aree problematiche per cui è stato costruito il modello. Un modello può contenere diversi di ciascuno.
- Dominio
- Language
- Compito
- Language modeling/generation, Question answering
Dimensione
Quanto è grande il modello e su quanti dati è stato addestrato. I parametri sono il valore che decide se si adatta a una determinata scheda grafica.
- Parametri
- 456B
- Dati di addestramento
- 7,200,000,000,000 tokens
- Dimensione del batch
- 128,000,000
Total Parameters: 456B Activated Parameters per Token: 45.9B Number Layers: 80 Hybrid Attention: a softmax attention is positioned after every 7 lightning attention. Number of attention heads: 64 Attention head dimension: 128 Mixture of Experts: Number of experts: 32 Expert hidden dimension: 9216 Top-2 routing strategy Positional Encoding: Rotary Position Embedding (RoPE) applied to half of the attention head dimension with a base frequency of 10,000,000 Hidden Size: 6144 Vocab Size: 200,064
7.2T tokens
1.28e8
Addestramento computazionale
L'aritmetica eseguita per addestrare il modello, misurata in operazioni in virgola mobile. È una misura di quanto costato l'addestramento, non di quanto velocemente il modello finito ti risponde.
- Addestramento computazionale
- 3.1 × 10²⁴ FLOP
- Come è stato stabilito
- Operation counting
6 FLOP / token / parameter * 45.9 * 10^9 activated parameters * 1.1408e+13 tokens = 3.1417632e+24 FLOP "Likely" confidence because the model is MoE (formula might not be that accurate) data trained on is 1.1408e+13 = ((16 million * 500)+7.2 trillion + 3.2 trillion + 1 trillion)
Il training run
Cosa è stato fisicamente necessario per addestrare: quali chip, quanti, per quanto tempo e cosa ha richiesto dalla rete elettrica.
- Hardware di addestramento
- NVIDIA H800 SXM5
Disponibilità
Se puoi ottenere il modello e eseguirlo sul tuo hardware, il che decide se una delle cifre della scheda grafica su questa pagina si applica.
- Pesi
- Open — downloadable
- Accesso al modello
- Open weights (restricted use)
- Codice di addestramento
- Unreleased
- Hugging Face
- MiniMaxAI
https://huggingface.co/MiniMaxAI/MiniMax-Text-01 "MiniMax may terminate this Agreement if you are in breach of any term or condition of this Agreement." code seems to be just inference code: https://github.com/MiniMax-AI/MiniMax-01
Come è classificato
Etichette che il dataset sorgente applica quando si monitorano modelli notevoli e quanto è fiducioso nell'entry.
- Probabilmente sopra 10²³ FLOP
- Yes
- Registrare fiducia
- Likely
Fonti
Da dove proviene questo record e quando è stato controllato l'ultima volta.
- Riferimento
- MiniMax-01: Scaling Foundation Models with Lightning Attention
- Ultimo aggiornamento
- 10 March 2026
Gli estremi
I dieci GPU più veloci che eseguono MiniMax-Text-01
Classificato per token stimati al secondo, la scheda più recente per prima dove le velocità sono pari. Poiché la generazione è limitata dalla larghezza di banda della memoria, questo ordinamento segue la larghezza di banda piuttosto che un benchmark di gioco..
Le GPU più piccole che ancora funzionano MiniMax-Text-01
La rotta più economica per entrare, in base alla capacità di memoria. Un adattamento stretto esegue il modello ma non lascia nulla in più per una conversazione più lunga..
- 01 Radeon Instinct MI325X 256 GB · Necessità 223.5 GB · Q3_K_M · Stretto 11.7 tok/s
- 02 B300 288 GB · Necessità 250.0 GB · IQ4_XS · Stretto 18.3 tok/s
- 03 Radeon Instinct MI350X 288 GB · Necessità 250.0 GB · IQ4_XS · Stretto 14.6 tok/s
- 04 Radeon Instinct MI355X 288 GB · Necessità 250.0 GB · IQ4_XS · Stretto 14.6 tok/s
Cosa significano i numeri
Cosa ti serve per eseguirlo
Scheda minima
Radeon Instinct MI325X
Memoria necessaria
223.5 GB
Più veloce
18.3 tok/s
A 456B parametri, MiniMax-Text-01 va oltre ciò che qualsiasi singola scheda grafica può contenere. Eseguirlo significa o suddividerlo tra più schede o noleggiare hardware progettato per il compito — 4 delle schede che monitoriamo possono contenerlo da sole, e tutte sono parti da datacenter.
L'hardware minimo funzionante è una Radeon Instinct MI325X. I suoi 256 GB sono sufficienti con compressione Q3_K_M, dando circa 11,7 token al secondo.
Il risultato più veloce arriva da un B300 a circa 18.3 token al secondo - i suoi 8,000 GB/s di larghezza di banda è ciò che lo consente.
Cosa è questo modello
MiniMax-Text-01 è stato pubblicato da MiniMax, in Cina, nel gennaio 2025. L'organizzazione è categorizzata come industria.
Funziona in Lingua ed è registrato come attività di modellazione/generazione del linguaggio, risposte alle domande.
I pesi pubblicati significano che il modello viene eseguito sulla tua macchina piuttosto che su quella di qualcun altro, ed è proprio questo che rende la domanda sull'hardware sottostante rispondibile. È pubblicato sotto l'organizzazione MiniMaxAI su Hugging Face.
Cosa decide la velocità
Su ogni scheda che può eseguirlo, la media della gamma è di circa 14,6 token al secondo, e 4 di esse superano i dieci token al secondo che corrispondono approssimativamente alla velocità di lettura.
Essendo denso, legge tutto se stesso per token, motivo per cui l'ordinamento per velocità di seguito segue così da vicino l'ordinamento per larghezza di banda di memoria.
La sua architettura interna non è presente nel file, quindi la memoria è approssimativa in base al numero di parametri e contrassegnata di conseguenza. Aspettati che il valore reale differisca, tanto più in contesti lunghi.
Come è stato addestrato
Produrlo ha richiesto circa 3.1 × 10²⁴ FLOP di aritmetica, su NVIDIA H800 SXM5, il che è una dichiarazione sul budget di allenamento piuttosto che sull'inferenza.
Circa 7.200.000.000.000 token sono stati utilizzati per addestrarlo.
Passo dopo passo
Come scegliere una GPU per MiniMax-Text-01
La tabella sopra ha già valutato ogni scheda in nostro possesso rispetto a questo modello. Per arrivare alla sua risposta sono necessari sei passaggi..
-
01
Controlla cosa necessita prima di ogni altra cosa
Ogni scheda qui è stata controllata contro MiniMax-Text-01 — circa 223.5 GB a Q3_K_M. La capacità è il cancello — una scheda o la contiene o non la contiene.
-
02
Imposta la lunghezza del contesto su cui lavorerai
Le conversazioni più lunghe richiedono memoria oltre a quella necessaria per i pesi. Sposta il cursore sulla tua reale lunghezza di lavoro prima di fidarti di qualsiasi riga per MiniMax-Text-01.
-
03
Imposta un livello di qualità
La colonna di quantizzazione varia a seconda della scheda, perché una scheda più grande contiene una copia più accurata di MiniMax-Text-01 — Q3_K_M sulla scheda più piccola che si adatta. Imposta un limite per mantenere il confronto su un livello.
-
04
Ordina per velocità
La velocità di ordinamento per MiniMax-Text-01 è effettivamente un ordinamento per larghezza di banda di memoria, motivo per cui il B300 lo sovrasta a 18,3 tok/s.
-
05
Controlla il verdetto di compatibilità prima di acquistare
Ingiusto significa che MiniMax-Text-01 si carica e funziona, senza spazio per aumentare il contesto in seguito. Confortevole significa che puoi. La differenza conta più di pochi token al secondo.
-
06
Apri la scheda su cui hai deciso.
Ogni nome di scheda è collegato alla propria pagina, che esegue lo stesso calcolo su tutto il catalogo dei modelli. Vale la pena di dare un'occhiata prima di acquistare per MiniMax-Text-01 da solo — una scheda è solitamente acquistata per più di un modello.
Risposte
MiniMax-Text-01 — Domande frequenti
Perché la quantizzazione differisce tra le schede per MiniMax-Text-01?
Ogni scheda viene mostrata eseguendo la copia meno compressa che può contenere, e MiniMax-Text-01 appare a 2 diversi livelli di compressione tra le schede che lo supportano. Schede più grandi ottengono la versione più accurata.
Quanto sono accurate queste stime di velocità del MiniMax-Text-01?
Vengono calcolati a partire dalle specifiche piuttosto che misurati, e ciascuno porta un intervallo — 11–29 tok/s sul B300, per esempio. Lo stesso modello e scheda variano dal trenta al cinquanta per cento a seconda del software di inferenza e della sua versione.
Quale GPU mi serve per eseguire MiniMax-Text-01?
La scheda più piccola nel nostro catalogo che supporta MiniMax-Text-01 è la Radeon Instinct MI325X, con 256 GB di memoria. Esegue il modello a Q3_K_M utilizzando circa 223,5 GB e produce circa 11,7 token al secondo. 4 schede in totale possono eseguirlo.
Quanto è veloce MiniMax-Text-01 su una GPU?
Dipende dalla scheda. La più veloce che calcoliamo è una B300 a circa 18,3 token al secondo; la più lenta che ancora riesce a farlo gestisce considerevolmente meno. La velocità di lettura è di circa dieci token al secondo, e 4 delle schede che possono eseguire MiniMax-Text-01 chiariscono ciò.
Quanta VRAM richiede MiniMax-Text-01?
Circa 223.5 GB a compressione Q3_K_M, che è ciò che utilizza la scheda più piccola che lo esegue. Meno compressione richiede di più: i numeri nella colonna della memoria sopra sono ricalcolati per ciascuna scheda, perché ognuna contiene la versione meno compressa possibile.
MiniMax-Text-01 è open source?
I suoi pesi sono pubblicati, quindi MiniMax-Text-01 può essere scaricato ed eseguito sul proprio hardware. Si noti che i pesi aperti non sono la stessa cosa del codice sorgente aperto nel senso completo — non dice nulla sui dati di addestramento, sul codice di addestramento o sui termini commerciali allegati.
Quanti parametri ha MiniMax-Text-01?
MiniMax-Text-01 ha 456B parametri. Parametri totali: 456B Parametri attivati per Token: 45.9B Numero di strati: 80 Attenzione Ibrida: un'attenzione softmax è posizionata dopo ogni 7 attenzioni lightning. Numero di teste di attenzione: 64 Dimensione della testa di attenzione: 128 Miscela di Esperti: Numero di esperti: 32 Dimensione nascosta degli esperti: 9216 Strategia di routing Top-2 Codifica Posizionale: Rotary Position Embedding (RoPE) applicata alla metà della dimensione della testa di attenzione con una frequenza base di 10,000,000 Dimensione Nascosta: 6144 Dimensione del Vocabolario: 200,064. Quella cifra è il totale e decide quanta memoria ha bisogno il modello — circa mezzo gigabyte per miliardo con la compressione che la maggior parte delle persone usa.
Chi ha creato MiniMax-Text-01?
MiniMax-Text-01 è stato pubblicato da MiniMax, con sede in Cina, classificato come industria.
Quando è stato rilasciato MiniMax-Text-01?
MiniMax-Text-01 è stato pubblicato nel gennaio 2025.
A cosa serve MiniMax-Text-01?
MiniMax-Text-01 funziona in Lingua ed è registrato come gestore di modellazione/generazione della lingua, Risposta a domande. Queste sono le aree intorno a cui è stato progettato; descrivono l'intento piuttosto che un confine rigido.
Dove posso scaricare MiniMax-Text-01?
I suoi pesi sono pubblicati sotto l'organizzazione MiniMaxAI su Hugging Face. Non ospitiamo file di modello: questo sito calcola quale hardware è necessario per eseguirli.
Quanto calcolo è stato utilizzato per addestrare MiniMax-Text-01?
Circa 3,1 × 10²⁴ FLOP, su NVIDIA H800 SXM5. Questo misura quanto è costato produrre il modello e non dice nulla su quanto velocemente risponde una volta addestrato — la velocità di inferenza deriva dalla larghezza di banda della memoria, non dal budget di addestramento.
Posso eseguire MiniMax-Text-01 se non entra nella mia GPU?
Parzialmente. I layer che non si adattano rimangono nella memoria di sistema e funzionano a una frazione della velocità, quindi un MiniMax-Text-01 per lo più scaricato è raramente conveniente — il caso più vicino che calcoliamo è mancante di 103,8 GB. Ogni cifra qui assume che l'intero modello sia sulla scheda.
Due GPU eseguirebbero MiniMax-Text-01 più velocemente?
La capacità si accumula tra le schede; la larghezza di banda no. Poiché 4 delle schede che monitoriamo già contengono MiniMax-Text-01 autonomamente, una seconda scheda è raramente la risposta qui.
L'altra direzione
Guardando la questione dall'altra parte?
Questa pagina inizia dal modello. Se possedete già una scheda e desiderate conoscere tutto ciò che può eseguire, inizia dall'hardware invece.