Qwen3-Coder-Next TPS-calculator

Open gewichten Alibaba 80B Parameters February 2026

Elke kaart hieronder wordt beoordeeld op basis van dit model bij de contextlengte en minimumkwaliteit die je kiest. Snelheid is een schatting voor een enkele aanvraag, berekend op basis van de geheugendoorvoer van de kaart en de grootte van het model eenmaal gecomprimeerd..

Berekend voor dit model

61 van 818 kaarten die het kunnen draaien

Kleinste kaart die past

A100 PCIe 40 GB

40 GB · Q3_K_M · 124 tok/s

Snelste kaart

B200

235 tok/s · 180 GB

Welke GPU's kunnen draaien Qwen3-Coder-Next?

Stel de invoer in, lees het antwoord

Een langere conversatie heeft meer geheugen nodig, wat dit model van kleinere kaarten kan duwen..

Verbergt kaarten die alleen in het model zouden passen door deze onder dit punt te comprimeren..

61 kaarten passen

Berekenen
Behoeften Kwantisatie Pas
235 tok/s

141–376 · model/modellen werkt niet / zal niet werken

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 80.7 GB Q8_0 Comfortabel
235 tok/s

141–376 · model/modellen werkt niet / zal niet werken

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 80.7 GB Q8_0 Comfortabel
188 tok/s

113–301 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 80.7 GB Q8_0 Comfortabel
188 tok/s

113–301 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 80.7 GB Q8_0 Comfortabel
150 tok/s

90–240 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 80.7 GB Q8_0 Comfortabel
144 tok/s

86–230 · model/modellen werkt niet / zal niet werken

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 80.7 GB Q8_0 Comfortabel
144 tok/s

86–230 · model/modellen werkt niet / zal niet werken

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 80.7 GB Q8_0 Comfortabel
144 tok/s

86–230 · model/modellen werkt niet / zal niet werken

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 62.0 GB Q6_K Nauw
144 tok/s

86–230 · model/modellen werkt niet / zal niet werken

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 62.0 GB Q6_K Nauw
138 tok/s

83–220 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 80.7 GB Q8_0 Comfortabel
135 tok/s

81–216 · model/modellen werkt niet / zal niet werken

GRID A100B NVIDIA 48 GB 1,870 GB/s May 2020 38.8 GB IQ4_XS Nauw
124 tok/s

74–198 · model/modellen werkt niet / zal niet werken

A100 PCIe 40 GB NVIDIA 40 GB 1,560 GB/s Jun 2020 34.1 GB Q3_K_M Nauw
124 tok/s

74–198 · model/modellen werkt niet / zal niet werken

A100 SXM4 40 GB NVIDIA 40 GB 1,560 GB/s May 2020 34.1 GB Q3_K_M Nauw
124 tok/s

74–198 · model/modellen werkt niet / zal niet werken

A800 PCIe 40 GB NVIDIA 40 GB 1,560 GB/s Nov 2022 34.1 GB Q3_K_M Nauw
122 tok/s

73–195 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Comfortabel
122 tok/s

73–195 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Comfortabel
122 tok/s

73–195 · model/modellen werkt niet / zal niet werken

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 80.7 GB Q8_0 Comfortabel
116 tok/s

70–185 · model/modellen werkt niet / zal niet werken

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 80.7 GB Q8_0 Nauw
106 tok/s

64–170 · model/modellen werkt niet / zal niet werken

H100 SXM5 64 GB NVIDIA 64 GB 2,020 GB/s Mar 2023 52.7 GB Q5_K_M Nauw
98.8 tok/s

59–158 · model/modellen werkt niet / zal niet werken

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Nauw
98.8 tok/s

59–158 · model/modellen werkt niet / zal niet werken

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Nauw
98.8 tok/s

59–158 · model/modellen werkt niet / zal niet werken

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 80.7 GB Q8_0 Nauw
96.8 tok/s

58–155 · model/modellen werkt niet / zal niet werken

RTX PRO 5000 Blackwell NVIDIA 48 GB 1,340 GB/s Mar 2025 38.8 GB IQ4_XS Nauw
87.2 tok/s

52–139 · model/modellen werkt niet / zal niet werken

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 62.0 GB Q6_K Nauw
87.2 tok/s

52–139 · model/modellen werkt niet / zal niet werken

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 62.0 GB Q6_K Nauw

Snelheden zijn schattingen voor een enkele aanvraag - één gesprek tegelijk - berekend uit geheugenbandbreedte, modelgrootte en kwantisatie. De werkelijke doorvoer varieert met de inferentietijd en de versie. Cijfers gepubliceerd door hardwareleveranciers meten veel gelijktijdige aanvragen en zijn veel hoger..

Opname

Volledige specificatie

Alles op record voor dit model. Het meeste beschrijft hoe het is getraind in plaats van hoe het draait — nuttige context om te beoordelen hoeveel werk erin is gestoken en hoe het zich verhoudt tot modellen die op een andere schaal zijn gebouwd..

Origine

Wie heeft dit model gebouwd, waar, en wanneer het is gepubliceerd.

Organisatie
Alibaba
Organisatietype
Industry
Land
China
Gepubliceerd
2 February 2026

Wat het doet

De probleemgebieden waarvoor het model is gebouwd. Een model kan er verschillende van elk dragen.

Domein
Language
Model/modelen kunnen niet passen in de GPU VRAM. Tight = bijna uitvoerbaar, comfortabel = draait eenvoudig met ruimte. Wat AI-model kan de GPU draaien?
Language modeling/generation, Coding
Basis model
Qwen3-Next-80B-A3B

Grootte

Hoe groot het model is en hoeveel data erop is getraind. Parameters zijn de cijfers die bepalen of het past op een bepaalde grafische kaart.

Parameters
80B

Finetune of Qwen3-Next-80B-A3B, which has 80 billion parameters

Training gegevens
tokens

Beschikbaarheid

Of u het model kunt verkrijgen en het op uw eigen hardware kunt draaien, wat bepaalt of een van de specificaties van de GPU op deze pagina van toepassing is.

Gewichten
Open — downloadable
Model toegang
Open weights (unrestricted)
Hugging Face
Qwen

Hoe het is geclassificeerd

Labels die op de bron-dataset van toepassing zijn bij het volgen van opvallende modellen, en hoe zeker het is van de invoer.

Waarom het wordt gevolgd
Discretionary
Model/modellen past niet / past niet.
Likely

Bronnen

Waar deze registratie vandaan komt en wanneer deze voor het laatst is gecontroleerd.

Referentie
Qwen3-Coder-Next: Pushing Small Hybrid Models on Agentic Coding
Laatste update
8 April 2026

De extremen

Wat de getallen betekenen

Wat je nodig hebt om het te draaien

Minimum kaart

A100 PCIe 40 GB

Geheugen nodig

34.1 GB

Snelste

235 tok/s

Qwen3-Coder-Next heeft 80B parameters, wat het boven consumentenharde software plaatst en in het bereik waar een kaart hiervoor wordt gekocht in plaats van ervoor geschikt te worden gemaakt. 61 van de kaarten die we volgen kunnen het bevatten.

De minste hardware die werkt is een A100 PCIe 40 GB. De 40 GB is genoeg bij Q3_K_M compressie, wat ongeveer 124 tokens per seconde oplevert.

Een B200 is de snelste die we voor het berekenen: ongeveer 235 tokens per seconde, van 8.000 GB/s geheugensnelheid.

Over dit model

Qwen3-Coder-Next werd gepubliceerd door Alibaba, in China, in februari 2026. industrie is de categorie waaronder de uitgever valt.

Het werkt in de taal en wordt geregistreerd als taalmodellering/generatie, Coderen.

Het is afgeleid van Qwen3-Next-80B-A3B in plaats van getraind vanaf nul, wat de gebruikelijke manier is waarop een gespecialiseerd model wordt geproduceerd.

Gepubliceerde gewichten betekenen dat het model op jouw machine draait in plaats van op die van iemand anders, wat de hardwarevraag hieronder überhaupt beantwoordbaar maakt. Het is gepubliceerd onder de Qwen-organisatie op Hugging Face.

Hoe snel het draait, en waarom

De helft van de kaarten die het vasthouden, beheert meer dan 82,9 tokens per seconde en 59 overschrijden de leessnelheid volledig.

Omdat het elke token via een subset van zijn gewichten leidt, produceert het tekst met de snelheid van een veel kleiner model. Het probleem is geheugen: alles moet nog steeds passen, zodat de snelheid een bonus is in plaats van een korting op hardware.

Het geheugen hier is geschat op basis van grootte in plaats van berekend vanuit de architectuur, wat niet is vastgelegd voor dit model - de getallen zijn indicatief in plaats van exact.

Training en afkomst

Het opnamecriterium is discrétionair.

Stap voor stap

Hoe een GPU te kiezen voor Qwen3-Coder-Next

De bovenstaande tabel heeft elke kaart die we hebben beoordeeld met specificaties tegen dit model. Naar je antwoord komen kost zes stappen..

  1. 01

    Controleer wat het nodig heeft voordat iets anders

    De tabel toont elke kaart die Qwen3-Coder-Next kan bevatten — ongeveer 34.1 GB bij Q3_K_M. Dat cijfer, niet de headline prestaties van de kaart, bepaalt of het draait.

  2. 02

    De GPU kan dit model niet draaien.

    Langer gesprekken kosten geheugen bovenop wat de gewichten nodig hebben. Beweeg de schuifregelaar naar je werkelijke werk lengte voordat je vertrouwen hebt in een rij voor Qwen3-Coder-Next.

  3. 03

    Kies hoe ver u het wilt comprimeren

    Compressie is wat Qwen3-Coder-Next laat passen op kleinere kaarten, ten koste van nauwkeurigheid — Q3_K_M op de kleinste kaart die past. Een minimumkwaliteit verwijdert de modellen die te ver gaan.

  4. 04

    Vergelijk tokens per seconde, niet specificaties

    Ranking op tokens per seconde voor Qwen3-Coder-Next volgt de geheugensnelheid, niet het aantal cores, wat de B200 bovenaan plaatst met 235 tok/s.

  5. 05

    Controleer het pas oordeel voordat je koopt

    Krap betekent Qwen3-Coder-Next laadt en werkt, zonder ruimte om de context later te verhogen. Comfortabel betekent dat je kunt. Het verschil is belangrijker dan een paar tokens per seconde.

  6. 06

    Open de kaart waarop je je hebt vastgesteld

    Elke kaartnaam linkt naar zijn eigen pagina, die dezelfde berekening uitvoert over de hele modelcatalogus. Zeker het bekijken waard voordat je koopt voor Qwen3-Coder-Next alleen — een kaart wordt meestal gekocht voor meer dan één model.

Antwoorden

Qwen3-Coder-Next — Voor veelgebruikte vragen

01

Zouden twee GPU's Qwen3-Coder-Next sneller kunnen draaien?

Twee kaarten kopen geheugen in plaats van snelheid. Dat doet er alleen toe voor Qwen3-Coder-Next als één kaart het niet kan houden — 61 kan dat, dus een tweede voegt weinig toe.

02

Waarom verschilt de quantisatie tussen kaarten voor Qwen3-Coder-Next?

Een grotere kaart houdt een nauwkeuriger kopie. Over de kaarten die Qwen3-Coder-Next draaien, worden 5 compressieniveaus gebruikt; de vloerregeling boven bevestigt het aan één.

03

Hoe nauwkeurig zijn deze Qwen3-Coder-Next snelheidsschattingen?

Dit zijn schattingen met echte foutbalken. Het snelste resultaat hier, 141–376 tok/s op de B200, kan redelijkerwijs overal binnen zijn gepubliceerde bereik terechtkomen, afhankelijk van welke runtime je gebruikt.

04

Welke GPU heb ik nodig om Qwen3-Coder-Next te draaien?

De kleinste kaart in onze catalogus die Qwen3-Coder-Next ondersteunt is de A100 PCIe 40 GB, met 40 GB geheugen. Het draait het model op Q3_K_M met ongeveer 34,1 GB en produceert ongeveer 124 tokens per seconde. In totaal kunnen 61 kaarten het draaien.

05

Hoe snel is Qwen3-Coder-Next op een GPU?

Het hangt af van de kaart. Het snelste dat we berekenen is een B200 op ongeveer 235 tokens per seconde; de langzaamste die het nog kan draaien, haalt aanzienlijk minder. De leessnelheid ligt rond de tien tokens per seconde, en 59 van de kaarten die Qwen3-Coder-Next kunnen draaien, halen dat.

06

hoeveel VRAM heeft Qwen3-Coder-Next nodig?

Ongeveer 34,1 GB bij Q3_K_M compressie, wat is wat de kleinste kaart die het draait gebruikt. Minder compressie heeft meer nodig: de cijfers in de geheugen kolom hierboven zijn opnieuw berekend voor elke kaart, omdat elke kaart de minst-gecomprimeerde versie heeft die het kan.

07

Is Qwen3-Coder-Next open source?

De gewichten zijn gepubliceerd, zodat Qwen3-Coder-Next kan worden gedownload en op uw eigen hardware kan worden uitgevoerd. Let op dat open gewichten niet hetzelfde zijn als open source in de volle zin — het zegt niets over de trainingsdata, de trainingscode, of de commerciële voorwaarden die eraan verbonden zijn.

08

Hoeveel parameters heeft Qwen3-Coder-Next?

Qwen3-Coder-Next heeft 80B parameters. Finetune van Qwen3-Next-80B-A3B, dat heeft 80 miljard parameters. Dat cijfer is het totaal, en het bepaalt hoeveel geheugen het model nodig heeft — ongeveer een halve gigabyte per miljard bij de compressie die de meeste mensen gebruiken.

09

Wie heeft Qwen3-Coder-Next gemaakt?

Qwen3-Coder-Next is gepubliceerd door Alibaba, gevestigd in China, gecategoriseerd als industrie.

10

Wanneer werd Qwen3-Coder-Next uitgebracht?

Qwen3-Coder-Next werd gepubliceerd in februari 2026.

11

Waarvoor wordt Qwen3-Coder-Next gebruikt?

Qwen3-Coder-Next werkt in Sprache en is geregistreerd als het uitvoeren van taalmodellering/generatie, codering. Een model kan meerdere van elk dragen, dus dit zijn de gebieden waarvoor het is gebouwd in plaats van een beperking op wat het zal proberen.

12

Waar kan ik Qwen3-Coder-Next downloaden?

De gewichten zijn gepubliceerd onder de Qwen-organisatie op Hugging Face. We hosten geen modelbestanden - deze site berekent welke hardware nodig is om ze te draaien.

13

Kan ik Qwen3-Coder-Next draaien als het niet past in mijn GPU?

Het kan worden gesplitst tussen het kaart- en systeemgeheugen, maar Qwen3-Coder-Next genereert op die manier pijnlijk langzaam — de dichtstbijzijnde misrekening die we berekenen is 14,6 GB tekort. Niets op deze pagina gaat uit van offloading.

Bron

originele publicatie

Model/modelen kunnen niet passen in de GPU VRAM. Tight = nauwelijks uitvoerbaar, comfortabel = draait gemakkelijk met ruimte. Welke AI model kan de GPU draaien? 8 April 2026

De andere richting

Kijk je er van de andere kant naar?

Deze pagina begint bij het model. Als je al een kaart hebt en alles wilt weten wat het kan draaien., model/modellen draait/draaien past niet/past niet goed strak = nauwelijks uitvoerbaar, comfortabel = draait gemakkelijk met speling.