Qwen3.5-27B Kalkulator TPS
Każda karta poniżej jest oceniana na podstawie tego modelu przy wybranej przez Państwa długości kontekstu i minimalnej jakości. Szybkość to szacunkowa wartość dla pojedynczego żądania, obliczana na podstawie przepustowości pamięci karty i rozmiaru modelu po kompresji..
Obliczono dla tego modelu
818 karty, dla których posiadamy specyfikacje
Najmniejsza karta, która pasuje
Xeon Phi 7120P
16 GB · Q3_K_M · 9.7 tok/s
Najszybsza karta
B200
125 tok/s · 180 GB
Karty graficzne, które mogą uruchomić Qwen3.5-27B?
Ustaw wejścia, odczytaj odpowiedź
Dłuższa rozmowa wymaga więcej pamięci, co może spowodować, że ten model wykraczy poza możliwości mniejszych kart.
Chowa karty, które pasowałyby tylko do modelu, poprzez jego skompresowanie poniżej tego punktu.
241 dopasowanie kart
Obliczanie| Potrzeby | Kwantaizacja | Fit | |||||
|---|---|---|---|---|---|---|---|
|
125
tok/s
75–201 · niskie zaufanie |
B200 NVIDIA | 180 GB | 8,000 GB/s | Jan 2024 | 29.6 GB | Q8_0 | Wygodny |
|
125
tok/s
75–201 · niskie zaufanie |
B300 NVIDIA | 288 GB | 8,000 GB/s | Sep 2025 | 29.6 GB | Q8_0 | Wygodny |
|
100
tok/s
60–160 · niskie zaufanie |
Radeon Instinct MI350X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 29.6 GB | Q8_0 | Wygodny |
|
100
tok/s
60–160 · niskie zaufanie |
Radeon Instinct MI355X AMD | 288 GB | 8,190 GB/s | Jan 2025 | 29.6 GB | Q8_0 | Wygodny |
|
80.1
tok/s
48–128 · niskie zaufanie |
Radeon Instinct MI300 AMD | 128 GB | 6,550 GB/s | Jan 2023 | 29.6 GB | Q8_0 | Wygodny |
|
76.7
tok/s
46–123 · niskie zaufanie |
H200 NVL NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 29.6 GB | Q8_0 | Wygodny |
|
76.7
tok/s
46–123 · niskie zaufanie |
H200 SXM 141 GB NVIDIA | 141 GB | 4,890 GB/s | Nov 2024 | 29.6 GB | Q8_0 | Wygodny |
|
73.4
tok/s
44–117 · niskie zaufanie |
Radeon Instinct MI325X AMD | 256 GB | 6,000 GB/s | Oct 2024 | 29.6 GB | Q8_0 | Wygodny |
|
65.2
tok/s
39–104 · niskie zaufanie |
Radeon Instinct MI300A AMD | 128 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Wygodny |
|
65.2
tok/s
39–104 · niskie zaufanie |
Radeon Instinct MI300X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Wygodny |
|
65.2
tok/s
39–104 · niskie zaufanie |
Radeon Instinct MI308X AMD | 192 GB | 5,325 GB/s | Dec 2023 | 29.6 GB | Q8_0 | Wygodny |
|
61.8
tok/s
37–99 · niskie zaufanie |
H100 NVL 94 GB NVIDIA | 94 GB | 3,940 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Wygodny |
|
52.7
tok/s
32–84 · niskie zaufanie |
H100 PCIe 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Wygodny |
|
52.7
tok/s
32–84 · niskie zaufanie |
H100 SXM5 80 GB NVIDIA | 80 GB | 3,360 GB/s | Oct 2022 | 29.6 GB | Q8_0 | Wygodny |
|
52.7
tok/s
32–84 · niskie zaufanie |
H100 SXM5 94 GB NVIDIA | 94 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Wygodny |
|
52.7
tok/s
32–84 · niskie zaufanie |
H100 SXM5 96 GB NVIDIA | 96 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Wygodny |
|
52.7
tok/s
32–84 · niskie zaufanie |
H800 SXM5 NVIDIA | 80 GB | 3,360 GB/s | Mar 2023 | 29.6 GB | Q8_0 | Wygodny |
|
47.8
tok/s
29–77 · niskie zaufanie |
Tesla V100 SXM2 16 GB NVIDIA | 16 GB | 1,130 GB/s | Nov 2019 | 13.9 GB | Q3_K_M | Ścisły |
|
42.6
tok/s
26–68 · niskie zaufanie |
DRIVE A100 PROD NVIDIA | 32 GB | 1,870 GB/s | May 2020 | 23.3 GB | Q6_K | Wygodny |
|
42.6
tok/s
26–68 · niskie zaufanie |
GRID A100A NVIDIA | 32 GB | 1,870 GB/s | May 2020 | 23.3 GB | Q6_K | Wygodny |
|
40.8
tok/s
24–65 · niskie zaufanie |
GeForce RTX 5090 NVIDIA | 32 GB | 1,790 GB/s | Jan 2025 | 23.3 GB | Q6_K | Wygodny |
|
40.8
tok/s
24–65 · niskie zaufanie |
GeForce RTX 5090 D NVIDIA | 32 GB | 1,790 GB/s | Jan 2025 | 23.3 GB | Q6_K | Wygodny |
|
40.6
tok/s
24–65 · niskie zaufanie |
GeForce RTX 5080 NVIDIA | 16 GB | 960 GB/s | Jan 2025 | 13.9 GB | Q3_K_M | Ścisły |
|
40.1
tok/s
24–64 · niskie zaufanie |
Radeon Instinct MI250 AMD | 128 GB | 3,280 GB/s | Nov 2021 | 29.6 GB | Q8_0 | Wygodny |
|
40.1
tok/s
24–64 · niskie zaufanie |
Radeon Instinct MI250X AMD | 128 GB | 3,280 GB/s | Nov 2021 | 29.6 GB | Q8_0 | Wygodny |
Prędkości są szacunkowe dla pojedynczego żądania — jednej rozmowy naraz — obliczane na podstawie przepustowości pamięci, rozmiaru modelu i kwantyzacji. Rzeczywista przepustowość zależy od czasu wykonywania inferencji oraz jej wersji. Wyniki publikowane przez dostawców sprzętu mierzą wiele równoczesnych żądań i są znacznie wyższe.
Na nagraniu
Pełna specyfikacja
Wszystko, co jest dostępne na temat tego modelu. Większość z tego opisuje, jak został wytrenowany, a nie jak działa — przydatny kontekst do oceny, ile pracy w to włożono i jak wypada na tle modeli zbudowanych na innym poziomie skali..
Pochodzenie
Kto zbudował ten model, gdzie i kiedy został opublikowany.
- Organizacja
- Alibaba
- Typ organizacji
- Industry
- Kraj
- China
- Opublikowane
- 24 February 2026
Co to robi
Obszary problemowe, dla których stworzono model. Model może zawierać kilka z każdej.
- Domena
- Language
- Zadanie
- Language modeling/generation
Rozmiar
Jakiej wielkości jest model i na ile danych był szkolony. Parametry to liczba, która decyduje, czy mieści się na danej karcie graficznej.
- Parametry
- 27B
- Dane treningowe
- tokens
Dostępność
Czy możesz zdobyć model i uruchomić go na swoim własnym sprzęcie, co decyduje, czy jakiekolwiek z danych dotyczących karty graficznej na tej stronie mają zastosowanie.
- Wagi
- Open — downloadable
- Dostęp do modelu
- Open weights (restricted use)
- Hugging Face
- Qwen
Jak jest klasyfikowane
Etykiety stosowane przez źródłowy zbiór danych podczas śledzenia znaczących modeli oraz jak pewny jest w danym wpisie.
- Zaufanie do nagrania
- Confident
Źródła
Skąd pochodzi ten rekord i kiedy był ostatnio sprawdzany.
- Referencja
- Qwen3.5: Towards Native Multimodal Agents
- Ostatnia aktualizacja
- 19 June 2026
Ekstrema
Dziesięć najszybszych GPU, które działają Qwen3.5-27B
Posortowane według szacowanej liczby tokenów na sekundę, najnowsza karta na pierwszym miejscu pod względem prędkości. Ponieważ generacja jest ograniczona przez przepustowość pamięci, to porządkuje się według przepustowości, a nie według jakiegokolwiek benchmarka gier..
- 01 B300 288 GB · 8,000 GB/s · Q8_0 125 tok/s
- 02 B200 180 GB · 8,000 GB/s · Q8_0 125 tok/s
- 03 Radeon Instinct MI350X 288 GB · 8,190 GB/s · Q8_0 100 tok/s
- 04 Radeon Instinct MI355X 288 GB · 8,190 GB/s · Q8_0 100 tok/s
- 05 Radeon Instinct MI300 128 GB · 6,550 GB/s · Q8_0 80.1 tok/s
- 06 H200 NVL 141 GB · 4,890 GB/s · Q8_0 76.7 tok/s
- 07 H200 SXM 141 GB 141 GB · 4,890 GB/s · Q8_0 76.7 tok/s
- 08 Radeon Instinct MI325X 256 GB · 6,000 GB/s · Q8_0 73.4 tok/s
- 09 Radeon Instinct MI300A 128 GB · 5,325 GB/s · Q8_0 65.2 tok/s
- 10 Radeon Instinct MI300X 192 GB · 5,325 GB/s · Q8_0 65.2 tok/s
Najmniejsze GPU, które nadal działają Qwen3.5-27B
Najtańsza droga do środka, według pojemności pamięci. Napięty montaż uruchamia model, ale nie pozostawia nic na dłuższą rozmowę..
- 01 Ryzen AI Z2 Extreme GPU 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 8.5 tok/s
- 02 Radeon RX 7700 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 20.5 tok/s
- 03 Arc Pro B50 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 6.2 tok/s
- 04 RTX PRO 2000 Blackwell 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 12.2 tok/s
- 05 Ryzen Z2 Extreme GPU 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 4.2 tok/s
- 06 Radeon RX 9060 XT 16 GB 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 10.6 tok/s
- 07 GeForce RTX 5060 Ti 16 GB 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 19.0 tok/s
- 08 GeForce RTX 5080 Mobile 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 37.9 tok/s
- 09 Radeon RX 9070 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 21.3 tok/s
- 10 Radeon RX 9070 XT 16 GB · Potrzeby 13.9 GB · Q3_K_M · Ścisły 21.3 tok/s
Co oznaczają liczby
Wymagania sprzętowe w praktyce
Minimalna karta
Xeon Phi 7120P
Potrzebna pamięć
13.9 GB
Najszybszy
125 tok/s
Z 27 miliardami parametrów, Qwen3.5-27B mieści się w zakresie, który poważna karta stacjonarna może obsłużyć, gdy wagi są skompresowane. 241 kart, które śledzimy, może ją uruchomić.
Punkt wejścia to Xeon Phi 7120P: 16 GB pamięci, kompresja Q3_K_M, około 9,7 tokenów na sekundę.
Najszybszy wynik pochodzi z B200 z prędkością około 125 tokenów na sekundę — to jego przepustowość 8 000 GB/s to zapewnia.
Czym jest ten model
Qwen3.5-27B został opublikowany przez Alibaba w Chinach w lutym 2026 roku. Przemysł jest kategorią, do której należy wydawca.
Działa w Języku i jest rejestrowany jako wykonujący modelowanie/generację języka.
Wagi są publikowane, więc można je pobrać i uruchomić na własnym sprzęcie przez czas nieokreślony, offline, bez konta. Zostały opublikowane w organizacji Qwen na Hugging Face.
Co decyduje o prędkości
Połowa kart, które to trzymają, osiąga więcej niż 19,0 tokenów na sekundę, a 196 przekracza prędkość odczytu bez wątpienia.
Każda waga uczestniczy w każdym tokenie tutaj, więc przepustowość to cała historia: poniższe zestawienie jest de facto rankingiem przepustowości pamięci.
Jego wewnętrzna architektura nie jest w pliku, więc pamięć jest przybliżona na podstawie liczby parametrów i oznaczona odpowiednio. Oczekuj, że rzeczywista wartość będzie różnić się, zwłaszcza w przypadku długiego kontekstu.
Krok po kroku
Jak wybrać GPU dla Qwen3.5-27B
Powyższa tabela już oceniła wszystkie karty, dla których posiadamy specyfikacje, w odniesieniu do tego modelu. Aby uzyskać odpowiedź, należy przejść przez sześć kroków..
-
01
Najpierw odczytaj liczby pamięci
Spójrz na to, czego Qwen3.5-27B naprawdę potrzebuje — około 13,9 GB przy Q3_K_M. Żaden poziom mocy obliczeniowej nie zrekompensuje karty, która nie może tego pomieścić.
-
02
Dopasuj kontekst do swojego aktualnego użycia
Dłuższe rozmowy kosztują pamięć oprócz tego, co potrzebują wagi. Przesuń suwak do swojej rzeczywistej długości roboczej zanim zaufasz któremuś wierszowi dla Qwen3.5-27B.
-
03
Ustal minimalną jakość
Każda karta uruchamia najmniej skompresowaną kopię, jaką może pomieścić — Q3_K_M na najmniejszej karcie, która pasuje. Ustalenie minimum usuwa karty, które tylko obsługują Qwen3.5-27B, przez dalsze ścisnienie, niż byś chciał.
-
04
Rób ranking według przepustowości, a nie karty specyfikacji
Ranking według tokenów na sekundę dla Qwen3.5-27B podąża za szerokością pasma pamięci, a nie liczbą rdzeni, co jest powodem, dla którego B200 plasuje się na szczycie z 125 tok/s.
-
05
Spójrz na zapas, nie tylko na dopasowanie
Tight pasuje Qwen3.5-27B, ale nie pozostawia nic na dłuższą rozmowę; comfortable ma zapas. Jeśli planujesz rozwinąć kontekst, kupuj dla comfortable.
-
06
Zobacz, co jeszcze ta karta uruchamia.
Śledzenie karty do jej własnej strony pokazuje każdy inny model, który może pomieścić, co jest pytaniem, które pojawia się po ustabilizowaniu Qwen3.5-27B.
Odpowiedzi
Qwen3.5-27B — Często zadawane pytania
Ile parametrów ma Qwen3.5-27B?
Qwen3.5-27B ma 27B parametrów. Ta liczba to całkowita suma i to ona decyduje o tym, ile pamięci potrzebuje model — około pół gigabajta na miliard przy kompresji, z której korzysta większość ludzi.
Kto stworzył Qwen3.5-27B?
Qwen3.5-27B został opublikowany przez Alibaba, z siedzibą w Chinach, sklasyfikowany jako przemysł.
Kiedy został wydany Qwen3.5-27B?
Qwen3.5-27B został opublikowany w lutym 2026 roku.
Do czego służy Qwen3.5-27B?
Qwen3.5-27B działa w języku i jest rejestrowany jako obsługujący modelowanie/generowanie języka. Model może obsługiwać kilka z każdej, więc to są obszary, dla których został stworzony, a nie ograniczenie tego, co spróbuje.
Gdzie mogę pobrać Qwen3.5-27B?
Jego wagi są publikowane pod organizacją Qwen na Hugging Face. Nie hostujemy plików modelu — ta strona oblicza, jaki sprzęt jest potrzebny do ich uruchomienia.
Czy mogę uruchomić Qwen3.5-27B, jeśli nie mieści się w moim GPU?
Tylko przez przenoszenie, które zwykle jest fałszywą oszczędnością: część w pamięci systemowej osłabia całość — najbliższy błąd, który obliczamy, jest krótki o 6,2 GB. Nasze dane dla Qwen3.5-27B zakładają, że jest w pełni obecny.
Czy dwa GPU uruchomią Qwen3.5-27B szybciej?
Pojemność dodaje się w kartach; przepustowość nie. Ponieważ 241 z kart, które śledzimy, już posiada Qwen3.5-27B samodzielnie, druga karta rzadko jest rozwiązaniem w tym przypadku.
Dlaczego kwantyzacja różni się między kartami dla Qwen3.5-27B?
Ponieważ pojemność się różni, tak samo różni się, jak mocno Qwen3.5-27B musi być ściskany — 5 odmiennych poziomów pojawia się w powyższej tabeli. Ustaw minimum jakości do porównania na jeden.
Jak dokładne są te szacunki prędkości Qwen3.5-27B?
Są obliczane na podstawie specyfikacji, a nie pomiarów, a każdy z nich ma zakres — 75–201 tok/s na B200, na przykład. Ten sam model i karta różnią się o trzydzieści do pięćdziesięciu procent w zależności od oprogramowania wnioskowania i jego wersji.
Jaką GPU potrzebuję, aby uruchomić Qwen3.5-27B?
Najmniejsza karta w naszym katalogu, która obsługuje Qwen3.5-27B, to Xeon Phi 7120P, z 16 GB pamięci. Uruchamia model na Q3_K_M, wykorzystując około 13,9 GB, i produkuje około 9,7 tokenów na sekundę. W sumie 241 kart może go uruchomić.
Jak szybko działa Qwen3.5-27B na GPU?
To zależy od karty. Najszybsza, jaką obliczamy, to B200 przy około 125 tokenach na sekundę; najwolniejsza, która nadal działa, osiąga znacznie mniej. Prędkość czytania wynosi około dziesięciu tokenów na sekundę, a 196 kart, które mogą uruchomić Qwen3.5-27B, to potwierdza.
Ile VRAM potrzebuje Qwen3.5-27B?
Około 13,9 GB przy kompresji Q3_K_M, co jest tym, co wykorzystuje najmniejsza karta, która to uruchamia. Mniejsza kompresja wymaga więcej: liczby w kolumnie pamięci powyżej są przeliczone dla każdej karty, ponieważ każda z nich przechowuje najmniej skompresowaną wersję, jaką może.
Czy mogę uruchomić Qwen3.5-27B na GPU 16 GB?
Tak. Tesla V100 SXM2 16 GB z 16 GB uruchamia to na Q3_K_M, używając około 13,9 GB i generując w przybliżeniu 47,8 tokenów na sekundę — ciasne dopasowanie.
Czy mogę uruchomić Qwen3.5-27B na GPU 24 GB?
Tak. GeForce RTX 5090 D V2 z 24 GB uruchamia to na Q5_K_M, używając około 20,2 GB i generując około 37,5 tokenów na sekundę — ciasne dopasowanie.
Czy Qwen3.5-27B jest open source?
Jego wagi są opublikowane, więc Qwen3.5-27B można pobrać i uruchomić na własnym sprzęcie. Zauważ, że otwarte wagi nie są tym samym co otwarte źródło w pełnym sensie — nie mówi to nic o danych treningowych, kodzie treningowym ani warunkach komercyjnych.
W innym kierunku
Patrząc na to z drugiej strony?
Ta strona zaczyna się od modelu. Jeśli już posiadasz kartę i chcesz wiedzieć, wszystko co będzie ona obsługiwać, Rozpocznij od sprzętu..