Llama 4 Maverick TPS-Rechner

Offene Gewichte Meta AI 400B Parameter April 2025

Jede Karte unten wird anhand dieses Modells im Kontextlänge und mit der von Ihnen gewählten Mindestqualität bewertet. Die Geschwindigkeit ist eine Schätzung für eine einzelne Anfrage, berechnet aus der Speicherbandbreite der Karte und der Größe des Modells nach der Komprimierung..

Berechnet für dieses Modell

6 Karten, die es ausführen können

818 Karten, für die wir Spezifikationen haben

Kleinste Karte, die passt

Radeon Instinct MI300X

192 GB · Q3_K_M · 65.9 tok/s

Schnellste Karte

B300

109 tok/s · 288 GB

Welche GPUs können laufen Llama 4 Maverick?

Stellen Sie die Eingaben ein, lesen Sie die Antwort.

Eine längere Unterhaltung erfordert mehr Speicher, was dieses Modell auf kleineren Karten aus dem Gleichgewicht bringen kann.

Verbirgt Karten, die nur auf das Modell passen würden, indem sie es darunter komprimieren.

6 Karten stimmen überein

Berechnung
Bedarf Quantisierung Passgenau
109 tok/s

65–174 · niedrige Verlässlichkeit

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 214.8 GB Q4_K_M Bequem
86.8 tok/s

52–139 · niedrige Verlässlichkeit

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 214.8 GB Q4_K_M Bequem
86.8 tok/s

52–139 · niedrige Verlässlichkeit

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 214.8 GB Q4_K_M Bequem
65.9 tok/s

40–105 · niedrige Verlässlichkeit

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 168.2 GB Q3_K_M eng anliegend
65.9 tok/s

40–105 · niedrige Verlässlichkeit

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 168.2 GB Q3_K_M eng anliegend
63.6 tok/s

38–102 · niedrige Verlässlichkeit

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 214.8 GB Q4_K_M eng anliegend

Geschwindigkeiten sind Schätzwerte für eine einzelne Anfrage — eine Konversation nach der anderen — berechnet anhand der Speicherbandbreite, Modelgröße und Quantisierung. Die tatsächliche Durchsatzrate variiert je nach Inferenzlaufzeit und Version. Von Hardwareherstellern veröffentlichte Werte messen viele gleichzeitige Anfragen und sind deutlich höher.

Aufzeichnung

Vollständige Spezifikation

Alles aufzeichnungsfähig für dieses Modell. Die meisten Informationen beschreiben, wie es trainiert wurde, anstatt wie es läuft — ein nützlicher Kontext, um zu beurteilen, wie viel Arbeit investiert wurde und wie es im Vergleich zu auf einer anderen Skala entwickelten Modellen abschneidet..

Ursprung

Wer hat dieses Modell gebaut, wo und wann es veröffentlicht wurde.

Organisation
Meta AI
Organisationstyp
Industry
Land
United States of America
Veröffentlicht
5 April 2025

Was es tut

Die Problemfelder, für die das Modell entwickelt wurde. Ein Modell kann mehrere von jedem tragen.

Domäne
Multimodal, Language, Vision
Aufgabe
Chat, Code generation, Visual question answering, Language modeling/generation, Question answering

Größe

Wie groß das Modell ist und wie viele Daten es trainiert wurde. Die Parameter sind die Größe, die entscheidet, ob es auf eine bestimmte Grafikkarte passt.

Parameter
400B

"Llama 4 Maverick models have 17B active parameters and 400B total parameters." https://ai.meta.com/blog/llama-4-multimodal-intelligence/

Trainingsdaten
30,000,000,000,000 tokens

"The overall data mixture for training consisted of more than 30 trillion tokens, which is more than double the Llama 3 pre-training mixture and includes diverse text, image, and video datasets."

Training-Computing

Die zur Ausbildung des Modells durchgeführte Arithmetik, gemessen in Gleitkommaoperationen. Es ist ein Maß dafür, was der Trainingslauf gekostet hat, nicht wie schnell das fertige Modell Ihnen antwortet.

Training-Computing
2.2 × 10²⁴ FLOP

22T training tokens per model card: https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md Maverick was trained using co-distillation from Llama 4 Behemoth. It isn't 100% clear that all 22T tokens used distillation, but we assume this for the time being. Estimating training compute from parameters and tokens: Compute = 6 FLOP per token per parameter * 17B active parameters * 22T tokens = 2.244e24 FLOP (Implying mean throughput was 262 TFLOPS/GPU, or 13.2% MFU in F…

Verfügbarkeit

Ob Sie das Modell erhalten und es auf Ihrer eigenen Hardware ausführen können, entscheidet darüber, ob eine der Grafikkartenfiguren auf dieser Seite zutrifft.

Gewichte
Open — downloadable
Modellzugang
Open weights (restricted use)
Trainingscode
Unreleased

Llama 4 license (branding requirements, size cap 700M MAU) https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Original no training code here https://github.com/meta-llama/llama-models/tree/main/models/llama4

Hugging Face
meta-llama

Wie es klassifiziert ist

Labels der Quelldatenbank, die beim Verfolgen bemerkenswerter Modelle angewendet werden, und wie zuversichtlich sie in den Eintrag ist.

Wahrscheinlich über 10²³ FLOP
Yes
Warum es nachverfolgt wird
Discretionary
Aufzeichnungszuversicht
Likely

Quellen

Woher diese Aufzeichnung stammt und wann sie zuletzt überprüft wurde.

Referenz
The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation
Zuletzt aktualisiert
28 November 2025

Was die Zahlen bedeuten

Hardware-Anforderungen in der Praxis

Mindestkarte

Radeon Instinct MI300X

Benötigter Speicher

168.2 GB

Schnellste

109 tok/s

Bei 400B Parametern übersteigt Llama 4 Maverick, was eine einzelne Grafikkarte halten kann. Es läuft darauf hinaus, entweder auf mehrere Karten zu verteilen oder Hardware zu mieten, die für die Aufgabe gebaut wurde - 6 der Karten, die wir verfolgen, können es alleine halten, und alle von ihnen sind Rechenzentrumsbauteile.

Der Einstiegspunkt ist die Radeon Instinct MI300X: 192 GB Speicher, Q3_K_M Kompression, etwa 65,9 Tokens pro Sekunde.

Ein B300 ist das Schnellste, das wir dafür berechnen: etwa 109 Tokens pro Sekunde, aus 8.000 GB/s Speicherbandbreite.

Was dieses Modell ist

Llama 4 Maverick wurde von Meta AI in den Vereinigten Staaten von Amerika im April 2025 veröffentlicht. Die Organisation ist als Industrie kategorisiert.

Es funktioniert in Multimodal, Sprache, Vision und wird aufgezeichnet, um Chat, Codegenerierung, visuelle Fragenbeantwortung, Sprachmodellierung/-generierung und Fragenbeantwortung durchzuführen.

Die Gewichte sind veröffentlicht, sodass sie heruntergeladen und unbegrenzt offline auf Ihrer eigenen Hardware ausgeführt werden können, ohne dass ein Konto erforderlich ist. Sie sind unter der Organisation meta-llama auf Hugging Face veröffentlicht.

Was entscheidet die Geschwindigkeit

Das mediane Ergebnis liegt bei etwa 76,3 Tokens pro Sekunde; 6 Karten erzeugen Texte schneller, als die meisten Menschen sie lesen.

Die Mischung-aus-Experten-Routing ist der Grund, warum die Geschwindigkeiten hier für die Anzahl der Parameter hoch erscheinen. Nur ein Bruchteil wird pro Token gelesen, aber das Ganze muss geladen werden.

Der Speicher hier wird anhand der Größe geschätzt, anstatt aus der Architektur berechnet, die für dieses Modell nicht aufgezeichnet ist - die Zahlen sind indikativ statt exakt.

Training und Herkunft

Die Produktion erforderte etwa 2,2 × 10²⁴ FLOP an Arithmetik, was eine Aussage über das Trainingsbudget und nicht über die Inferenz ist.

Es wurde mit etwa 30.000.000.000.000 Tokens Text trainiert.

Das Einschlusskriterium ist diskretionär.

Schritt für Schritt

Wie wählt man eine GPU für Llama 4 Maverick

Die oben stehende Tabelle hat bereits jede Karte, für die wir Spezifikationen besitzen, mit diesem Modell verglichen. Um zu Ihrer Antwort zu gelangen, sind sechs Schritte erforderlich.

  1. 01

    Lies zuerst die Speichergröße ab

    Die Tabelle listet jede Karte auf, die Llama 4 Maverick halten kann — etwa 168,2 GB bei Q3_K_M. Diese Zahl, nicht die Spitzenleistung der Karte, entscheidet darüber, ob sie läuft.

  2. 02

    Passen Sie den Kontext an Ihre tatsächliche Nutzung an

    Setze den Kontext auf das, was du tatsächlich verwenden wirst. Der Cache wächst mit dem Gespräch, und es ist der übliche Grund, warum Llama 4 Maverick nicht mehr in eine Karte passt, die zuvor passend schien.

  3. 03

    Entscheiden Sie, wie viel Kompression Sie akzeptieren werden.

    Die Quantisierungs-Spalte variiert je nach Karte, da eine größere Karte eine genauere Kopie von Llama 4 Maverick — Q3_K_M auf der kleinsten Karte hält, die passt. Setzen Sie einen Boden, um den Vergleich auf einem Niveau zu halten.

  4. 04

    Rangfolge nach Durchsatz statt nach Spezifikationen

    Das Ranking nach Tokens pro Sekunde für Llama 4 Maverick folgt der Speicherbandbreite, nicht den Kernzahlen, weshalb die B300 mit 109 Tok/s führt.

  5. 05

    Lies die Spalte "angepasst" zuletzt

    Ein knapper Sitz läuft Llama 4 Maverick, lässt jedoch keinen Spielraum für ein längeres Gespräch; komfortabel hat Spielraum. Wenn Sie erwarten, den Kontext zu erweitern, kaufen Sie für komfortabel.

  6. 06

    Sieh dir an, was diese Karte noch ausführt

    Jede Karten Seite wiederholt diesen Überblick für jedes Modell, das wir haben. Es beantwortet, wofür die Hardware sonst noch gut ist, neben Llama 4 Maverick.

Antworten

Llama 4 Maverick — Häufig gestellte Fragen

01

Wie viel Rechenleistung wurde verwendet, um Llama 4 Maverick zu trainieren?

Etwa 2,2 × 10²⁴ FLOP. Das misst, was die Produktion des Modells gekostet hat und sagt nichts darüber aus, wie schnell es einmal trainiert antwortet - die Inferenzgeschwindigkeit kommt von der Speicherbandbreite, nicht vom Trainingsbudget.

02

Kann ich Llama 4 Maverick ausführen, wenn es nicht in meine GPU passt?

Teilweise. Schichten, die nicht passen, sitzen im Systemspeicher und laufen mit einem Bruchteil der Geschwindigkeit, sodass ein meist ausgelagerter Llama 4 Maverick selten sinnvoll ist — das nächste Defizit, das wir berechnen, liegt 52,8 GB unter dem Minimum. Jede Zahl hier geht davon aus, dass das gesamte Modell auf der Karte ist.

03

Würden zwei GPUs Llama 4 Maverick schneller ausführen?

Die Kapazität addiert sich über die Karten; der Durchsatz nicht. Da 6 der Karten, die wir verfolgen, bereits Llama 4 Maverick für sich alleine halten, ist eine zweite Karte selten die Lösung hier.

04

Warum unterscheidet sich die Quantisierung zwischen den Karten für Llama 4 Maverick?

Eine größere Karte enthält eine genauere Kopie. Bei den Karten, die Llama 4 Maverick ausführen, werden 2 Kompressionsstufen verwendet; die Bodensteuerung darüber pinnt sie auf eine.

05

Wie genau sind diese Llama 4 Maverick Geschwindigkeitsschätzungen?

Sie werden aus Spezifikationen berechnet, anstatt gemessen, und jeder hat einen Bereich - 65–174 tok/s auf der B300, zum Beispiel. Das gleiche Modell und die gleiche Karte variieren um dreißig bis fünfzig Prozent, je nach Inferenzsoftware und deren Version.

06

Welche GPU brauche ich, um Llama 4 Maverick auszuführen?

Die kleinste Karte in unserem Katalog, die Llama 4 Maverick unterstützt, ist die Radeon Instinct MI300X mit 192 GB Speicher. Sie läuft das Modell bei Q3_K_M und nutzt etwa 168,2 GB und produziert ungefähr 65,9 Tokens pro Sekunde. Insgesamt können 6 Karten es ausführen.

07

Wie schnell ist Llama 4 Maverick auf einer GPU?

Es hängt von der Karte ab. Die schnellste, die wir berechnen, ist eine B300 mit etwa 109 Tokens pro Sekunde; die langsamste, die es noch ausführt, schafft erheblich weniger. Die Lesegeschwindigkeit liegt bei etwa zehn Tokens pro Sekunde, und 6 der Karten, die Llama 4 Maverick ausführen können, schaffen das.

08

Wie viel VRAM benötigt Llama 4 Maverick?

Über 168,2 GB bei Q3_K_M-Kompression, was die kleinste Karte, die es ausführt, verwendet. Weniger Kompression benötigt mehr: Die Zahlen in der Speicherspalte oben werden für jede Karte neu berechnet, da jede die am wenigsten komprimierte Version halten kann.

09

Ist Llama 4 Maverick Open Source?

Seine Gewichte sind veröffentlicht, sodass Llama 4 Maverick auf Ihrer eigenen Hardware heruntergeladen und ausgeführt werden kann. Beachten Sie, dass offene Gewichte nicht dasselbe wie Open Source im vollen Sinne sind — es sagt nichts über die Trainingsdaten, den Trainingscode oder die damit verbundenen kommerziellen Bedingungen aus.

10

Wie viele Parameter hat Llama 4 Maverick?

Llama 4 Maverick hat 400B Parameter. "Llama 4 Maverick Modelle haben 17B aktive Parameter und 400B Gesamtparameter." Diese Zahl ist die Gesamtheit und bestimmt, wie viel Speicher das Modell benötigt - ungefähr ein halbes Gigabyte pro Billion bei der Kompression, die die meisten Leute verwenden.

11

Wer hat Llama 4 Maverick erstellt?

Llama 4 Maverick wurde von Meta AI, mit Sitz in den Vereinigten Staaten von Amerika, veröffentlicht und als Branche kategorisiert.

12

Wann wurde Llama 4 Maverick veröffentlicht?

Llama 4 Maverick wurde im April 2025 veröffentlicht.

13

Wofür wird Llama 4 Maverick verwendet?

Llama 4 Maverick arbeitet in Multimodal, Sprache, Vision und wird als fähig aufgezeichnet, Chat, Code-Generierung, visuelles Fragenbeantworten, Sprachmodellierung/-generierung, Fragenbeantwortung zu verarbeiten. Ein Modell kann mehrere von jedem tragen, sodass dies die Bereiche sind, für die es gebaut wurde, anstatt eine Grenze für das, was es versuchen wird, darzustellen.

14

Wo kann ich Llama 4 Maverick herunterladen?

Ihre Gewichte sind unter der meta-llama Organisation auf Hugging Face veröffentlicht. Wir hosten keine Modelfiles — diese Seite berechnet, welche Hardware benötigt wird, um sie auszuführen.

Quelle

Originalveröffentlichung

Letzte Aktualisierung des Datensatzes 28 November 2025

Die andere Richtung

Wenn Sie es von der anderen Seite betrachten?

Diese Seite beginnt beim Modell. Wenn Sie bereits eine Karte besitzen und alles erfahren möchten, was es ausführen kann, Beginnen Sie stattdessen mit der Hardware.