Qwen3.5-9B TPS kalkulátor

Megnyitás súlyok Alibaba 9B Paraméterek February 2026

Az alábbi kártyákat ebben a modellben értékeljük a kiválasztott kontextus hossz és minimális minőség alapján. A sebesség egy becslés egyetlen kérésre, amelyet a kártya memória sávszélessége és a tömörített modell mérete alapján számolunk ki..

Számítások ennél a modellenél

582 kártyák, amelyek képesek futtatni

818 kártyák, amelyekhez specifikációkat tartunk fenn

A legkisebb kártya, ami illik

Quadro 6000

6 GB · Q3_K_M · 15.5 tok/s

Leggyorsabb kártya

B200

376 tok/s · 180 GB

Mely GPU-k képesek futtatni Qwen3.5-9B?

Állítsa be a bemeneteket, olvassa el a választ

Egy hosszabb beszélgetés több memóriát igényel, ami elmozdíthatja ezt a modellt kisebb kártyákról.

Elrejti azokat a kártyákat, amelyek csak a modellhez illeszkednének, ha azt ennél az értéknél kisebbre tömörítené.

582 kártyák egyezése

Számítás
Szükségletek Kvantizáció Arányosítva
376 tok/s

226–602 · alacsony bizalom

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 10.3 GB Q8_0 kényelmes
376 tok/s

226–602 · alacsony bizalom

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 10.3 GB Q8_0 kényelmes
301 tok/s

180–481 · alacsony bizalom

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 10.3 GB Q8_0 kényelmes
301 tok/s

180–481 · alacsony bizalom

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 10.3 GB Q8_0 kényelmes
240 tok/s

144–385 · alacsony bizalom

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 10.3 GB Q8_0 kényelmes
230 tok/s

138–368 · alacsony bizalom

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 10.3 GB Q8_0 kényelmes
230 tok/s

138–368 · alacsony bizalom

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 10.3 GB Q8_0 kényelmes
220 tok/s

132–352 · alacsony bizalom

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 10.3 GB Q8_0 kényelmes
195 tok/s

117–313 · alacsony bizalom

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 10.3 GB Q8_0 kényelmes
195 tok/s

117–313 · alacsony bizalom

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 10.3 GB Q8_0 kényelmes
195 tok/s

117–313 · alacsony bizalom

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 10.3 GB Q8_0 kényelmes
185 tok/s

111–297 · alacsony bizalom

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 10.3 GB Q8_0 kényelmes
158 tok/s

95–253 · alacsony bizalom

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.3 GB Q8_0 kényelmes
158 tok/s

95–253 · alacsony bizalom

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 10.3 GB Q8_0 kényelmes
158 tok/s

95–253 · alacsony bizalom

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 10.3 GB Q8_0 kényelmes
158 tok/s

95–253 · alacsony bizalom

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 10.3 GB Q8_0 kényelmes
158 tok/s

95–253 · alacsony bizalom

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 10.3 GB Q8_0 kényelmes
125 tok/s

75–200 · alacsony bizalom

CMP 170HX 8 GB NVIDIA 8 GB 1,490 GB/s Sep 2021 7.2 GB Q5_K_M Szoros
120 tok/s

72–193 · alacsony bizalom

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 10.3 GB Q8_0 kényelmes
120 tok/s

72–193 · alacsony bizalom

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 10.3 GB Q8_0 kényelmes
107 tok/s

64–171 · alacsony bizalom

CMP 170HX 10 GB NVIDIA 10 GB 1,560 GB/s Sep 2021 8.2 GB Q6_K Szoros
100 tok/s

60–161 · alacsony bizalom

Data Center GPU Max 1550 Intel 128 GB 3,280 GB/s Jan 2023 10.3 GB Q8_0 kényelmes
98.2 tok/s

59–157 · alacsony bizalom

Data Center GPU Max Subsystem Intel 128 GB 3,210 GB/s Jan 2023 10.3 GB Q8_0 kényelmes
96.0 tok/s

58–154 · alacsony bizalom

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 10.3 GB Q8_0 kényelmes
96.0 tok/s

58–154 · alacsony bizalom

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 10.3 GB Q8_0 kényelmes

A sebességek egyetlen kérésre vonatkoznak — egy beszélgetésenként —, a memória sávszélesség, a modell mérete és a kvantálás alapján számítva. A valós átvitel a felismerési futásidőtől és annak verziójától függően változik. A hardvergyártók által közzétett adatokat több egyidejű kérés mérésére mérik, és sokkal magasabbak.

Felvételen

Teljes specifikáció

Minden adatok ezen a modellen. A legtöbb leírás arról szól, hogyan volt kiképzve, nem pedig arról, hogyan fut — hasznos háttérinformáció arra vonatkozóan, hogy mennyi munka került bele, és hogyan viszonyul más méretű modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
Alibaba
Szervezet típusa
Industry
Ország
China
Kiadva
24 February 2026

Mit csinál

A modell által épített probléma területek. Egy modell több különbözőt is tartalmazhat.

Irányítószám
Language
Feladat
Language modeling/generation

Méret

Mekkora a modell és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek meghatározzák, hogy illeszkedik-e egy adott grafikus kártyára.

Paraméterek
9B
Képzési adatok
tokens

Elérhetőség

Hogy megszerezheted-e a modellt és futtathatod a saját hardvereden, ami eldönti, hogy a ezen az oldalon szereplő grafikus kártyák adatai alkalmazhatóak-e.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (restricted use)
Hugging Face
Qwen

Hogyan van besorolva

Címkék, amelyeket a forráshalmaz alkalmaz, amikor figyelemmel kíséri a figyelemre méltó modelleket, és mennyire biztos a bejegyzésben.

Rögzítési bizalom
Confident

Források

Honnan származik ez a rekord és mikor ellenőrizték utoljára.

Referencia
Qwen3.5: Towards Native Multimodal Agents
Utoljára frissítve
19 June 2026

A szélsőségek

Mit jelentek a számok

Mi kell ennek a modellnek a futtatásához

Minimum kártya

Quadro 6000

Szükséges memória

5.1 GB

Leggyorsabb

376 tok/s

A Qwen3.5-9B elég kicsi 9B paraméterrel ahhoz, hogy a hardver ritkán legyen akadály — az általunk követett 582 kártya képes futtatni, beleértve több éves kártyákat is.

A legkisebb kártya, amely képes rá, a Quadro 6000 6 GB-tal, amely Q3_K_M-n fut, és körülbelül 15,5 tokent termel másodpercenként.

A másik végén egy B200 körülbelül 376 tokent generál másodpercenként, 8,000 GB/s memóriásebesség alapján.

Erről a modellről

A Qwen3.5-9B kiadása az Alibaba által történt, Kínában, 2026 februárjában. Az ipar az a kategória, amelybe a kiadó tartozik.

Működik a Nyelven, és nyelvi modellezés/generálás közben rögzítik.

Mivel a súlyai ki lettek adva, semmi nem függ attól, hogy egy szolgáltató elérhető maradjon – egyszer letöltve a tiéd. A Qwen szervezet alatt került közzétételre a Hugging Face-en.

Hogyan gyorsan fut, és miért

A kártyák fele, amelyek tartják, több mint 21,1 tokent kezel, és 541 egyenesen meghaladja az olvasási sebességet.

Minden súly részt vesz minden tokenben itt, így a sávszélesség a teljes történet: az alábbi rangsor lényegében a memória áteresztőképességének rangsora.

A memória itt a méretből van megbecsülve, nem pedig az architektúrából számítva, amely nincs rögzítve ehhez a modellhez — a számok csak tájékoztató jellegűek, nem pontosak.

Lépésről lépésre

Hogyan válasszon GPU-t Qwen3.5-9B

A fent továbbiakban ismertetett táblázat már értékelte az összes kártyát, amelynek specifikációit e modellhez viszonyítottuk. A válasz eléréséhez hat lépést kell megtennie..

  1. 01

    Nézd meg, mire van szüksége, mielőtt bármi mást csinálnál.

    Nézd meg, hogy a Qwen3.5-9B-nek valójában mire van szüksége — körülbelül 5.1 GB-ra az Q3_K_M-en. Egyetlen mennyiségű feldolgozási teljesítmény sem kompenzál egy kártyát, amely nem képes elférni rajta.

  2. 02

    Döntse el, mennyi ideig tartanak a beszélgetései.

    A beszélgetés is elfoglal memóriát, és növekszik, ahogy halad. Állítsd a csúszkát az elvárt hosszúságra: hosszú kontextusnál a Qwen3.5-9B lecsúszhat egy olyan kártyáról, amely könnyen kezeli a rövid kérdéseket.

  3. 03

    Döntsön arról, mennyi tömörítést fogad el

    A kvantálási oszlop kártyánként változik, mert egy nagyobb kártya pontosabb másolatot tartalmaz a Qwen3.5-9B — Q3_K_M számára, amely a legkisebb kártyán fér el. Állítson be egy padlót, hogy a összehasonlítás egy szinten maradjon.

  4. 04

    Hasonlítsa össze a másodpercenkénti tokeneket, ne a specifikációkat.

    Rendezze sebesség szerint, hogy lássa, hogyan rangsorolódnak a kártyák a Qwen3.5-9B esetében. Nem fog illeszkedni a játékok szerinti rendeléshez — a generálás memória sávszélességhez kötött, ezért a B200 376 tok/s sebességgel vezeti a sort.

  5. 05

    Olvasd el az illeszkedés oszlopát utoljára

    Egy szoros illeszkedés fut a Qwen3.5-9B-n, de semmit sem hagy szabadon egy hosszabb beszélgetéshez; a kényelmesnek van mozgástere. Ha arra számít, hogy bővíteni fogja a kontextust, vásároljon a kényelmesért.

  6. 06

    Nyisd meg azt a kártyát, amelyen döntöttél.

    Minden kártyaoldal megismétli ezt a körforgást minden modellnél, ami a birtokunkban van. Válaszolja meg, hogy a hardver miben hasznos még a Qwen3.5-9B-n túl.

Válaszok

Qwen3.5-9B — Gyakran ismételt kérdések

01

Mennyi VRAM-ra van szüksége a Qwen3.5-9B-nek?

Körülbelül 5,1 GB Q3_K_M tömörített állapotban, ami a legkisebb kártya számára szükséges. Kevesebb tömörítéshez több szükséges: a memóriában szereplő számok minden kártya esetében újraszámításra kerülnek, mivel mindegyik a lehető legkevésbé tömörített verziót tartja.

02

Futtathatom a Qwen3.5-9B-t egy 8 GB-os GPU-n?

Igen. Egy CMP 170HX 8 GB 8 GB memóriával Q5_K_M módban futtatja, körülbelül 7.2 GB-ot használva és körülbelül 125 tokent generál másodpercenként — szűk illeszkedés.

03

Futhatok Qwen3.5-9B-t egy 12 GB-os GPU-n?

Igen. Egy GeForce RTX 3080 Ti 12 GB-tal Q8_0-n futtatja, körülbelül 10.3 GB-ot használva és körülbelül 42.9 token másodpercenkénti generálással — elég szoros.

04

Futtathatom a Qwen3.5-9B-t egy 16 GB-os GPU-n?

Igen. Egy Tesla V100 SXM2 16 GB 16 GB RAM-mal Q8_0-n működik, körülbelül 10,3 GB-ot használ, és körülbelül 53,2 tokent generál másodpercenként - kényelmesen fut.

05

Futtathatom a Qwen3.5-9B-t egy 24 GB-os GPU-n?

Igen. Egy GeForce RTX 5090 D V2 24 GB RAM-mal képes Q8_0-n futtatni, körülbelül 10,3 GB-ot használ és körülbelül 63,1 tokent generál másodpercenként — kényelmesen elfér.

06

Nyílt forráskódú a Qwen3.5-9B?

Súlyai közzétéve vannak, így a Qwen3.5-9B letölthető és futtatható a saját hardverén. Vegye figyelembe, hogy a nyílt súlyok nem azonosak a nyílt forrással teljes értelemben — ez nem mond semmit a tanító adatról, a tanító kódról, vagy a csatolt kereskedelmi feltételekről.

07

Hány paramétere van a Qwen3.5-9B-nek?

A Qwen3.5-9B-nak 9B paramétere van. Ez a szám a teljes, és ez határozza meg, hogy mennyi memória szükséges a modellnek — körülbelül fél gigabyte milliárdonként az emberek által használt tömörítési módszer szerint.

08

Ki alkotta meg a Qwen3.5-9B-t?

A Qwen3.5-9B kiadásra került az Alibaba által, amely Kínában található, ipari kategóriába sorolva.

09

Mikor jelent meg a Qwen3.5-9B?

A Qwen3.5-9B 2026 februárjában jelent meg.

10

Mi a Qwen3.5-9B célja?

A Qwen3.5-9B működik a Nyelvben, és nyelvmodellezés/nyelvgenerálás kezelésére van rögzítve. A modellek gyakran több mint egyet hordoznak mindenből, és a címkék a célt írják le, nem pedig a képesség korlátait.

11

Hol tölthetem le a Qwen3.5-9B-t?

Súlyait a Qwen szervezet közzéteszi a Hugging Face-en. Nem tárolunk modellek fájlt — ez az oldal kiszámítja, hogy milyen hardver szükséges a futtatásukhoz.

12

Futtathatom a Qwen3.5-9B-t, ha nem fér el a GPU-mban?

Részben. Azok a rétegek, amelyek nem férnek el, a rendszermemóriában ülnek és a sebesség töredékén futnak, így a túlnyomórészt leterhelt Qwen3.5-9B használata ritkán ér meg valamit - a legközelebbi túllépést, amit számolunk, 1.6 GB-val marad el. Minden szám itt azt feltételezi, hogy az egész modell a kártyán van.

13

Futtatna két GPU a Qwen3.5-9B-t gyorsabban?

A kapacitás kártyákonként összeadódik; a teljesítmény nem. Mivel a nyomon követett kártyák 582-e már magában foglalja a Qwen3.5-9B-t, egy második kártya itt ritkán jelent megoldást.

14

Miért különbözik a kvantálás a kártyák között a Qwen3.5-9B esetében?

Minden kártya a legkevésbé tömörített másolatának futását mutatja, és a Qwen3.5-9B négy különböző tömörítési szinten jelenik meg azokon a kártyákon, amelyek elférnek benne. A nagyobb kártyák a pontosabb verziót kapják.

15

Mennyire pontosak ezek a Qwen3.5-9B sebességbecslések?

A specifikációkból számítják ki őket, nem pedig mérik, és mindegyiknek van egy tartománya — például 226–602 tok/s a B200-on. Ugyanez a modell és kártya harminc és ötven százalék között változik a következtetési szoftver és annak verziója függvényében.

16

Milyen GPU-ra van szükségem a Qwen3.5-9B futtatásához?

A legkisebb kártya a katalógusunkban, amely támogatja a Qwen3.5-9B-t, a Quadro 6000, 6 GB memóriával. A modellt a Q3_K_M-en futtatja, körülbelül 5.1 GB-ot használva, és körülbelül 15.5 tokent állít elő másodpercenként. Összesen 582 kártya tudja futtatni.

17

Milyen gyors a Qwen3.5-9B egy GPU-n?

Attól függ, hogy melyik kártyáról van szó. A leggyorsabb, amit számítunk, egy B200, körülbelül 376 token másodpercenként; a leglassabb, ami még működik, lényegesen kevesebbet teljesít. Az olvasási sebesség körülbelül tíz token másodpercenként, és 541 az olyan kártyák közül, amelyek képesek futtatni a Qwen3.5-9B-t, ezt egyértelműen teljesítik.

Forrás

Eredeti közzététel

Utolsó frissítés időpontja 19 June 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már rendelkezik egy kártyával és szeretné tudni, hogy minden mit fog futtatni, kérjük, folytassa., kezdje a hardverrel inkább.