Qwen3.5-4B TPS kalkulátor

Megnyitás súlyok Alibaba 4B Paraméterek February 2026

Az alábbi kártyákat ebben a modellben értékeljük a kiválasztott kontextus hossz és minimális minőség alapján. A sebesség egy becslés egyetlen kérésre, amelyet a kártya memória sávszélessége és a tömörített modell mérete alapján számolunk ki..

Számítások ennél a modellenél

818 kártyák, amelyek képesek futtatni

818 kártyák, amelyekhez specifikációkat tartunk fenn

A legkisebb kártya, ami illik

Tesla C1080

4 GB · Q5_K_M · 16.5 tok/s

Leggyorsabb kártya

B200

847 tok/s · 180 GB

Mely GPU-k képesek futtatni Qwen3.5-4B?

Állítsa be a bemeneteket, olvassa el a választ

Egy hosszabb beszélgetés több memóriát igényel, ami elmozdíthatja ezt a modellt kisebb kártyákról.

Elrejti azokat a kártyákat, amelyek csak a modellhez illeszkednének, ha azt ennél az értéknél kisebbre tömörítené.

818 kártyák egyezése

Számítás
Szükségletek Kvantizáció Arányosítva
847 tok/s

508–1,355 · alacsony bizalom

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 5.0 GB Q8_0 kényelmes
847 tok/s

508–1,355 · alacsony bizalom

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 5.0 GB Q8_0 kényelmes
676 tok/s

406–1,082 · alacsony bizalom

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 5.0 GB Q8_0 kényelmes
676 tok/s

406–1,082 · alacsony bizalom

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 5.0 GB Q8_0 kényelmes
541 tok/s

325–866 · alacsony bizalom

Radeon Instinct MI300 AMD 128 GB 6,550 GB/s Jan 2023 5.0 GB Q8_0 kényelmes
518 tok/s

311–828 · alacsony bizalom

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 5.0 GB Q8_0 kényelmes
518 tok/s

311–828 · alacsony bizalom

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 5.0 GB Q8_0 kényelmes
496 tok/s

297–793 · alacsony bizalom

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 5.0 GB Q8_0 kényelmes
440 tok/s

264–704 · alacsony bizalom

Radeon Instinct MI300A AMD 128 GB 5,325 GB/s Dec 2023 5.0 GB Q8_0 kényelmes
440 tok/s

264–704 · alacsony bizalom

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 5.0 GB Q8_0 kényelmes
440 tok/s

264–704 · alacsony bizalom

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 5.0 GB Q8_0 kényelmes
417 tok/s

250–667 · alacsony bizalom

H100 NVL 94 GB NVIDIA 94 GB 3,940 GB/s Mar 2023 5.0 GB Q8_0 kényelmes
356 tok/s

213–569 · alacsony bizalom

H100 PCIe 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 5.0 GB Q8_0 kényelmes
356 tok/s

213–569 · alacsony bizalom

H100 SXM5 80 GB NVIDIA 80 GB 3,360 GB/s Oct 2022 5.0 GB Q8_0 kényelmes
356 tok/s

213–569 · alacsony bizalom

H100 SXM5 94 GB NVIDIA 94 GB 3,360 GB/s Mar 2023 5.0 GB Q8_0 kényelmes
356 tok/s

213–569 · alacsony bizalom

H100 SXM5 96 GB NVIDIA 96 GB 3,360 GB/s Mar 2023 5.0 GB Q8_0 kényelmes
356 tok/s

213–569 · alacsony bizalom

H800 SXM5 NVIDIA 80 GB 3,360 GB/s Mar 2023 5.0 GB Q8_0 kényelmes
271 tok/s

163–433 · alacsony bizalom

Radeon Instinct MI250 AMD 128 GB 3,280 GB/s Nov 2021 5.0 GB Q8_0 kényelmes
271 tok/s

163–433 · alacsony bizalom

Radeon Instinct MI250X AMD 128 GB 3,280 GB/s Nov 2021 5.0 GB Q8_0 kényelmes
226 tok/s

135–361 · alacsony bizalom

Data Center GPU Max 1550 Intel 128 GB 3,280 GB/s Jan 2023 5.0 GB Q8_0 kényelmes
221 tok/s

133–353 · alacsony bizalom

Data Center GPU Max Subsystem Intel 128 GB 3,210 GB/s Jan 2023 5.0 GB Q8_0 kényelmes
216 tok/s

130–346 · alacsony bizalom

A100 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Nov 2020 5.0 GB Q8_0 kényelmes
216 tok/s

130–346 · alacsony bizalom

A100X NVIDIA 80 GB 2,040 GB/s Jun 2021 5.0 GB Q8_0 kényelmes
216 tok/s

130–346 · alacsony bizalom

A800 SXM4 80 GB NVIDIA 80 GB 2,040 GB/s Aug 2022 5.0 GB Q8_0 kényelmes
216 tok/s

130–346 · alacsony bizalom

H100 CNX NVIDIA 80 GB 2,040 GB/s Mar 2023 5.0 GB Q8_0 kényelmes

A sebességek egyetlen kérésre vonatkoznak — egy beszélgetésenként —, a memória sávszélesség, a modell mérete és a kvantálás alapján számítva. A valós átvitel a felismerési futásidőtől és annak verziójától függően változik. A hardvergyártók által közzétett adatokat több egyidejű kérés mérésére mérik, és sokkal magasabbak.

Felvételen

Teljes specifikáció

Minden adatok ezen a modellen. A legtöbb leírás arról szól, hogyan volt kiképzve, nem pedig arról, hogyan fut — hasznos háttérinformáció arra vonatkozóan, hogy mennyi munka került bele, és hogyan viszonyul más méretű modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
Alibaba
Szervezet típusa
Industry
Ország
China
Kiadva
24 February 2026

Mit csinál

A modell által épített probléma területek. Egy modell több különbözőt is tartalmazhat.

Irányítószám
Language
Feladat
Language modeling/generation

Méret

Mekkora a modell és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek meghatározzák, hogy illeszkedik-e egy adott grafikus kártyára.

Paraméterek
4B
Képzési adatok
tokens

Elérhetőség

Hogy megszerezheted-e a modellt és futtathatod a saját hardvereden, ami eldönti, hogy a ezen az oldalon szereplő grafikus kártyák adatai alkalmazhatóak-e.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (restricted use)
Hugging Face
Qwen

Hogyan van besorolva

Címkék, amelyeket a forráshalmaz alkalmaz, amikor figyelemmel kíséri a figyelemre méltó modelleket, és mennyire biztos a bejegyzésben.

Rögzítési bizalom
Confident

Források

Honnan származik ez a rekord és mikor ellenőrizték utoljára.

Referencia
Qwen3.5: Towards Native Multimodal Agents
Utoljára frissítve
26 May 2026

A szélsőségek

Mit jelentek a számok

Hardverkövetelmények a gyakorlatban

Minimum kártya

Tesla C1080

Szükséges memória

3.6 GB

Leggyorsabb

847 tok/s

A Qwen3.5-4B annyira kicsi 4B paraméterrel, hogy a hardver ritkán jelent akadályt - az általunk nyomon követett kártyák 818-a képes futtatni, beleértve több éves kártyákat is.

A belépési pont a Tesla C1080: 4 GB memória, Q5_K_M tömörítés, körülbelül 16,5 token másodpercenként.

A B200 a leggyorsabb, amit kalkulálunk: körülbelül 847 token másodpercenként, 8,000 GB/s memória sávszélességről.

Erről a modellről

A Qwen3.5-4B kiadásra került az Alibaba által, Kínában, 2026 februárjában. az ipar a kategória, amelybe a kiadó tartozik.

Működik a Nyelven, és nyelvi modellezés/generálás közben rögzítik.

A közzétett súlyok azt jelentik, hogy a modell a te gépeden fut, nem pedig valaki másén, ami egyedül válaszolhatóvá teszi az alábbi hardver kérdést. A Qwen szervezet alatt került közzétételre a Hugging Face-en.

Hogyan gyorsan fut, és miért

A medián eredmény körülbelül 28,4 token másodpercenként; 776 kártya gyorsabban állít elő szöveget, mint ahogy a legtöbb ember elolvassa.

Mivel sűrű, minden tokenje alapján olvas magából, ezért az alábbi sebességszerinti sorrend túlságosan követi a memóriakapacitás szerinti sorrendet.

Figyelemelterelés nélküli elrendezés mellett a memóriaoszlop egy közelítés. Elég közel van ahhoz, hogy hardvert válasszunk, és a hosszú kontextusnál a legkevésbé megbízható.

Lépésről lépésre

Hogyan válasszon GPU-t Qwen3.5-4B

A fent továbbiakban ismertetett táblázat már értékelte az összes kártyát, amelynek specifikációit e modellhez viszonyítottuk. A válasz eléréséhez hat lépést kell megtennie..

  1. 01

    Kezdj a memória oszloptól

    Nézd meg, hogy valójában mire van szüksége a Qwen3.5-4B-nek — körülbelül 3.6 GB a Q5_K_M-nél. Semmilyen mennyiségű feldolgozási teljesítmény nem kompenzálja azt a kártyát, amely nem tudja befogadni.

  2. 02

    Illessze a kontextust a tényleges használatához

    Állítsa be a kontextust arra, amit valójában használni fog. A gyorsítótár a beszélgetéssel együtt nő, és ez a szokásos oka annak, hogy a Qwen3.5-4B megáll a kártyán, ami jónak tűnt.

  3. 03

    Válaszd ki, mennyire akarod tömöríteni.

    Minden kártya a lehető legkevésbé tömörített másolatot futtatja, amit képes tartani — Q5_K_M a legkisebb kártyán, ami elfér. A padló beállítása levágja azokat a kártyákat, amelyek csak a Qwen3.5-4B-t tudják kezelni, azzal, hogy még inkább összenyomja, mint amit szeretne.

  4. 04

    Rangsorolás áteresztőképesség alapján, nem a specifikációs lap szerint

    A Qwen3.5-4B token/másodperc szerinti rangsorolása a memória sávszélességet követi, nem a magok számát, amiért a B200 847 tok/s sebességgel vezet.

  5. 05

    Olvasd el az illeszkedés oszlopát utoljára

    A fit oszlop elválasztja azokat a kártyákat, amelyek épp csak kezelik a Qwen3.5-4B-t azoktól, amelyeknek van szabad helyük. Vásárolj a másodikért, ha a kontextus esetleg bővülhet.

  6. 06

    Nézd meg, mit tud még az a kártya futtatni.

    Minden kártyanév saját oldalára mutat, amely ugyanazt a számítást végzi az egész modell katalóguson. Érdemes megnézni vásárlás előtt a Qwen3.5-4B-ért — egy kártyát általában több modellhez vásárolnak.

Válaszok

Qwen3.5-4B — Gyakran ismételt kérdések

01

Ki alkotta a Qwen3.5-4B-t?

A Qwen3.5-4B-t az Alibaba adta ki, amely Kínában található, ipari kategóriába sorolták.

02

Mikor jelent meg a Qwen3.5-4B?

A Qwen3.5-4B 2026 februárjában jelent meg.

03

Mire használják a Qwen3.5-4B-t?

A Qwen3.5-4B a Nyelven működik, és nyelvi modellezést/generálást kezel. A modellek gyakran több, mint egyet hordoznak mindegyikből, és a címkék a célt írják le, nem a képességkorlátozásokat.

04

Hol tudom letölteni a Qwen3.5-4B-t?

Súlyait a Qwen szervezet közzéteszi a Hugging Face-en. Nem tárolunk modellek fájlt — ez az oldal kiszámítja, hogy milyen hardver szükséges a futtatásukhoz.

05

Futtathatom a Qwen3.5-4B-t, ha nem fér el a GPU-mban?

El lehet osztani a kártya és a rendszer memória között, de a Qwen3.5-4B így fájdalmasan lassan generál. Ezen az oldalon semmi sem számít a terheléscsökkentésre.

06

Futna két GPU a Qwen3.5-4B gyorsabban?

Egy második kártya körülbelül megduplázza a rendelkezésre álló memóriát, de nem a generálási sebességet. A 818 kártyával, amely már képes egyedül futtatni a Qwen3.5-4B-t, a párba állítás indoka gyenge.

07

Miért különbözik a kvantálás a kártyák között a Qwen3.5-4B esetében?

Egy nagyobb kártya pontosabb másolatot tartalmaz. Azokon a kártyákon, amelyek Qwen3.5-4B-t futtatnak, 3 tömörítési szintet használnak; a padlón a vezérlés ezt egy szintre rögzíti.

08

Mennyire pontosak ezek a Qwen3.5-4B sebességbecslések?

Ezek valós hibaüzenetekkel ellátott becslések. A leggyorsabb eredmény itt, 508–1,355 tok/s a B200-on, ésszerűen bárhol a publikált tartományán belül elhelyezkedhet, attól függően, hogy melyik futási időt használja.

09

Milyen GPU-ra van szükségem a Qwen3.5-4B futtatásához?

A legkisebb kártya a katalógusunkban, amely tartja a Qwen3.5-4B-t, a Tesla C1080, 4 GB memóriával. A modellt Q5_K_M-en futtatja, körülbelül 3,6 GB-ot használva, és körülbelül 16,5 tokent termel másodpercenként. Összesen 818 kártya képes futtatni.

10

Milyen gyors a Qwen3.5-4B egy GPU-n?

Ez a kártyától függ. A leggyorsabb számításunk egy B200 körülbelül 847 token másodpercenként; a leglassabb, ami még fut, lényegesen kevesebbet tud. Az olvasási sebesség körülbelül tíz token másodpercenként, és a Qwen3.5-4B-t futtatni tudó kártyák közül 776 teljesíti ezt.

11

Mennyi VRAM szükséges a Qwen3.5-4B-nek?

Körülbelül 3,6 GB Q5_K_M tömörítéssel, amely azokat a legkisebb kártyákat használja, amelyek futtatják. Kevesebb tömörítés több: a fenti memória oszlopában szereplő számok minden kártyára újraszámítva, mert mindegyik a lehető legkevésbé tömörített változatot tárolja.

12

Futtathatom a Qwen3.5-4B-t egy 8 GB-os GPU-n?

Igen. Egy CMP 170HX 8 GB 8 GB-tal Q8_0-n fut, körülbelül 5.0 GB-ot használ, és körülbelül 158 tokent generál másodpercenként — kényelmesen illeszkedik.

13

Futtathatom a Qwen3.5-4B-t egy 12 GB-os GPU-n?

Igen. Egy GeForce RTX 3080 Ti 12 GB-tal Q8_0-n futtatja, körülbelül 5.0 GB-ot használva és körülbelül 96.6 tokent generálva másodpercenként — kényelmesen illeszkedik.

14

Futtathatom a Qwen3.5-4B-t egy 16 GB-os GPU-n?

Igen. Egy Tesla V100 SXM2 16 GB 16 GB-tal futtatja Q8_0-n, körülbelül 5,0 GB-ot használva, és körülbelül 120 tokent generál másodpercenként — kényelmesen illeszkedik.

15

Futhatok Qwen3.5-4B-t egy 24 GB GPU-n?

Igen. Egy GeForce RTX 5090 D V2 24 GB-tal Q8_0-n futtatja, körülbelül 5.0 GB-t használva és körülbelül 142 tokent generál másodpercenként — kényelmesen elfér.

16

A Qwen3.5-4B nyílt forráskódú?

A súlyait nyilvánosságra hozták, így a Qwen3.5-4B letölthető és futtatható a saját hardverén. Vegye figyelembe, hogy a nyílt súlyok nem ugyanazt jelentik, mint a valódi nyílt forráskód — ez semmit sem mond a tanító adataikról, a tanító kódokról, vagy a kapcsolódó kereskedelmi feltételekről.

17

Hány paramétere van a Qwen3.5-4B-nek?

A Qwen3.5-4B-nek 4B paramétere van. Ez a szám a teljes, és ez dönti el, mennyi memória szükséges a modellnek — nagyjából fél gigabájt milliárdonként a legtöbb ember által használt tömörítés esetén.

Forrás

Eredeti közzététel

Utolsó frissítés időpontja 26 May 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már rendelkezik egy kártyával és szeretné tudni, hogy minden mit fog futtatni, kérjük, folytassa., kezdje a hardverrel inkább.