Oblicz TPS dla tego Arc B570 na lokalnych modelach AI

Intel 10 GB GDDR6 380 GB/s January 2025

Każdy model w naszym katalogu oceniany jest na podstawie tego arkusza w kontekście długości i minimalnej jakości, które wybierze Pan/Pani. Prędkość to oszacowanie dla pojedynczego żądania, obliczone na podstawie przepustowości pamięci tego arkusza oraz rozmiaru każdego modelu po kompresji..

Obliczono dla tej karty

381 modele, które może uruchomić

679 modeli w naszym katalogu łącznie

Największy model, który obsługuje

Ling-lite-1.5 ("Bailing")

16.8B · Q3_K_M · 16.8 tok/s

najszybszy model

Gemma 3 QAT 1B

105 tok/s · 1B

Które modele AI mogą działać na Arc B570?

Ustaw wejścia, odczytaj odpowiedź

Więcej kontekstu oznacza więcej pamięci na pamięć podręczną rozmowy. Prędkość dotyczy nowej rozmowy i nie zmienia się w zależności od tego ustawienia.

Ukrywa modele, które zmieściłyby się tylko przy kompresji poniżej tego punktu.

381 modele pasują

Obliczanie
Kwantaizacja Fit
105 tok/s

63–167 · niskie zaufanie

Gemma 3 1B 1B Mar 2025 1.8 GB 33k tokeny Q8_0 Wygodny
105 tok/s

63–167 · niskie zaufanie

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k tokeny Q8_0 Wygodny
105 tok/s

63–167 · niskie zaufanie

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k tokeny ? Q8_0 Wygodny
105 tok/s

63–167 · niskie zaufanie

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k tokeny ? Q8_0 Wygodny
105 tok/s

63–167 · niskie zaufanie

OLMo-1B 1B Feb 2024 1.8 GB 131k tokeny ? Q8_0 Wygodny
105 tok/s

63–167 · niskie zaufanie

Pythia-1b 1B Apr 2023 1.8 GB 131k tokeny ? Q8_0 Wygodny
98.0 tok/s

59–157 · niskie zaufanie

DeepSeekMoE-16B 16B Jan 2024 8.1 GB 4k tokeny Q3_K_M Ścisły
96.9 tok/s

58–155 · niskie zaufanie

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k tokeny ? Q8_0 Wygodny
95.1 tok/s

57–152 · niskie zaufanie

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
95.1 tok/s

57–152 · niskie zaufanie

SantaCoder 1.1B Jan 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
95.1 tok/s

57–152 · niskie zaufanie

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
95.1 tok/s

57–152 · niskie zaufanie

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
87.2 tok/s

52–139 · niskie zaufanie

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
87.2 tok/s

52–139 · niskie zaufanie

MinerU2.5 1.2B Sep 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
87.2 tok/s

52–139 · niskie zaufanie

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k tokeny ? Q8_0 Wygodny
87.2 tok/s

52–139 · niskie zaufanie

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
85.1 tok/s

51–136 · niskie zaufanie

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k tokeny Q8_0 Wygodny
83.9 tok/s

50–134 · niskie zaufanie

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

DigiRL 1.3B Jun 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
80.5 tok/s

48–129 · niskie zaufanie

Otter 1.3B May 2023 2.1 GB 131k tokeny ? Q8_0 Wygodny

Prędkości są szacunkowe dla pojedynczego żądania — jednej rozmowy naraz — obliczane na podstawie przepustowości pamięci, rozmiaru modelu i kwantyzacji. Rzeczywista przepustowość zależy od czasu wykonywania inferencji oraz jej wersji. Wyniki publikowane przez dostawców sprzętu mierzą wiele równoczesnych żądań i są znacznie wyższe.

Na nagraniu

Arc B570 Pełna specyfikacja

Wszystko z zapisów dla tej płyty, uporządkowane według tego, jak bardzo wpływają na uruchomienie modelu językowego, a nie według tego, jak opisuje je karta specyfikacji. Pamięć jest na pierwszym miejscu, ponieważ decyduje o wyniku; reszta to kontekst.

Pamięć

Dwie specyfikacje, które decydują, jakie modele ta karta może uruchomić i jak szybko. Pojemność określa, które modele pasują; przepustowość określa, ile tokenów na sekundę produkują, gdy już to robią.

Rozmiar pamięci
10 GB
Przepustowość pamięci
380 GB/s
Typ pamięci
GDDR6
Szerokość magistrali pamięci
160 bit
Takt pamięci
2.38 GHz

Chips

Który procesor znajduje się na płycie i jak został wyprodukowany. Mniejszy rozmiar procesu zazwyczaj oznacza lepszą wydajność przy tym samym zużyciu energii.

Procesor graficzny
BMG-G21
Architektura
Xe2-HPG
Generacja
Battlemage(Arc 5)
Foundry
TSMC
Rozmiar procesów
5 nm
Tranzystory
19.6 billion
Gęstość tranzystorów
72,100 K/mm²
Rozmiar die
272 mm²
Wydano
16 January 2025

Częstotliwości zegara

Jak szybko działa procesor. Warto znacznie mniej tutaj niż na benchmarku gier: generowanie tekstu jest ograniczone przepustowością pamięci, więc wyższa częstotliwość ledwie wpływa na wynik.

Bazowe zegary
2.5 GHz
Prędkość boost
2.5 GHz

Jednostki przetwarzające

Co zawiera chip. Te elementy napędzają wydajność grafiki i są istotne głównie dla przetwarzania długiego promptu, a nie dla produkcji odpowiedzi.

Jednostki cieniujące
2,304
Jednostki mapowania tekstur
144
Jednostki wyjściowe renderowania
80
Rdzenie ray tracing
18
cache L1
250 KB
L2 pamięć podręczna
18 MB

Teoretyczna wydajność

Szczytowe stawki arytmetyczne opublikowane dla płyty. Są to limity, których żaden rzeczywisty obciążenie nie osiąga, a generowanie tekstu osiąga tylko małą część z nich, ponieważ jest ograniczone przez pamięć, a nie przez obliczenia.

Półprecyzyjność (FP16)
23 TFLOPS
Pojedyncza precyzja (FP32)
11.5 TFLOPS
Podwójna precyzja (FP64)
1.4 TFLOPS
Wskaźnik pikseli
200 GPixel/s
Wskaźnik tekstury
360 GTexel/s

Płyta

Co jest potrzebne do fizycznej instalacji i zasilania karty — praktyczne ograniczenia, które decydują o tym, czy pasuje do maszyny, którą już posiadasz.

Pobór mocy (TDP)
150 W
Zalecany zasilacz
450 W
Złącza zasilania
1x 8-pin
Interfejs szyny buseskiej
PCIe 4.0 x8
Szerokość slotu
Dual-slot
Wymiary
272 mm
Wyświetlaj wyniki
1x HDMI 2.1a, 3x DisplayPort 2.1

Wsparcie oprogramowania

Jakie interfejsy graficzne i obliczeniowe obsługuje karta. Zdolność obliczeniowa CUDA jest tą, która ma znaczenie dla wnioskowania: poniżej 7.0 nie ma rdzeni tensorowych, a nowoczesne oprogramowanie do wnioskowania przechodzi na wolniejsze ścieżki kodowe.

DirectX
12.2
OpenGL
4.6
Vulkan
1.4
OpenCL
3.0
Model cieniowania
6.6

Wpisy

Gdzie można kupić a Arc B570

Obecnie żaden sprzedawca nie oferuje tej karty. Oferty pochodzą od sprzedawców, którzy publikują je tutaj bezpośrednio — przeglądaj katalog dostawców aby zobaczyć, kto sprzedaje co.

Co oznaczają liczby

Co oznacza podsystem pamięci dla AI

Pamięć

10 GB

Przepustowość

380 GB/s

Największy model

Ling-lite-1.5 ("Bailing")

Przy 10 GB GDDR6, Arc B570 jest ograniczony do mniejszego końca katalogu. Około 9 GB jest faktycznie dostępne dla czasu wykonywania, a model musi całkowicie zmieścić się w nim przed wygenerowaniem czegokolwiek.

Magistrala pamięci przesyła 380 GB/s przez magistralę 160-bitową. To jest liczba, która rządzi prędkością generacji — arytmetyka na bajt otwarty jest wystarczająco mała, że to magistrala, a nie rdzenie, jest tym, na co wszystko czeka.

Wartość to zegar pamięci — 2.38 GHz tutaj — pomnożony przez szerokość magistrali. To dlatego liczba rdzeni tak źle przewiduje prędkość generacji.

Złożone, największy model, który pasuje, to Ling-lite-1.5 ("Bailing") o pojemności 16,8B, działający na Q3_K_M i produkujący około 16,8 tokenów na sekundę.

Chip i jak został zbudowany

Arc B570 jest zbudowany na procesorze graficznym BMG-G21, wykorzystując architekturę Intel Xe2-HPG, jako część generacji Battlemage (Arc 5).

Chip jest produkowany przez TSMC, w procesie 5 nm, z die o wymiarach 272 mm², zawierającym 19,6 miliarda tranzystorów. Mniejszy proces na ogół oznacza lepszą wydajność przy tej samej mocy, chociaż dla modeli językowych ma to znacznie mniejsze znaczenie niż podsystem pamięci.

Został wydany w styczniu 2025 roku, około 1 roku temu. Wsparcie oprogramowania do wnioskowania zwykle podąża za sprzętem o rok lub dwa, więc karta w tym wieku zazwyczaj ma dostępne dojrzałe, dobrze zoptymalizowane ścieżki kodowe.

Przepustowość obliczeniowa i dlaczego ma mniejsze znaczenie, niż się wydaje

FP16

23 TFLOPS

FP64

1.4 TFLOPS

Na papierze Arc B570 osiąga 23 TFLOPS przy północnej precyzji i 11,5 TFLOPS przy pojedynczej precyzji. To są wartości szczytowe, których żadne rzeczywiste obciążenie nie utrzymuje, a generowanie tekstu osiąga tylko małą część z nich — dekodowanie jest ograniczone przez pamięć, a nie przez arytmetykę, co jest powodem, dla którego karta może wyglądać na ogromnie potężną tutaj i wciąż produkować tokeny w zwyczajnym tempie.

Przepustowość podwójnej precyzji wynosi 1.4 TFLOPS. Nie ma to wpływu na uruchamianie modelu językowego — żaden czas wykonania wnioskowania go nie wykorzystuje — ale oddziela elementy datacenter od konsumenckich, ponieważ te ostatnie celowo je ograniczają.

Zegary działają od 2,5 GHz w wersji podstawowej do 2,5 GHz z przyspieszeniem. Wartość tutaj znacznie mniejsza niż na benchmarku gamingowym: podniesienie prędkości zegara zwiększa obliczenia, a obliczenia to nie to, na co czeka generacja.

Cache i jednostki przetwarzania

Arc B570 ma 250 KB pamięci cache L1, wspieranej przez 18 MB pamięci L2. Cache pochłania część ruchu pamięci, który w przeciwnym razie uderzyłby w główną szynę, która jest jednym miejscem na tej stronie, gdzie liczba inna niż przepustowość cicho wpływa na prędkość generacji — duża L2 pozwala na to, aby więcej zestawów roboczych pozostawało blisko rdzeni.

Jest 2,304 jednostek cieniowania, 144 jednostek mapowania tekstur i 80 jednostek wyjścia renderowania. Napędzają one obciążenia graficzne i przyczyniają się do przetwarzania zapytań, ale przez większość czasu, który model spędza na generowaniu odpowiedzi, pozostają bezczynne.

Moc, rozmiar i instalacja

Pobór mocy

150 W

Karta Arc B570 jest oceniana na 150 W, a dla całego systemu sugerowane jest zasilanie 450 W. Uruchamianie modelu językowego obciąża kartę w szeregach, a nie ciągle - zużywa dużo energii podczas generowania i pozostaje w stanie bezczynności między żądaniami - dlatego stałe poboru w ciągu roboczego dnia jest zazwyczaj znacznie poniżej ocenianej wartości.

Płyta zajmuje podwójny slot, mierząc 272 mm długości, i potrzebuje 1x 8-pin. Warto sprawdzić z obudową i zasilaczem już w maszynie, ponieważ największe karty potrzebują znacznie więcej zarówno jednego, jak i drugiego niż typowy komputer stacjonarny dostarcza.

Łączy się przez PCIe 4.0 x8. Interfejs określa, jak szybko model jest ładowany z dysku do karty, a nie jak szybko działa po tym, jak się tam znajdzie, więc węższe połączenie kosztuje kilka sekund przy uruchamianiu, a później nic.

Ekstrema

Największe modele AI, które uruchamiają się na Arc B570

Największe modele o otwartych wagach, które mieszczą się na tej karcie, najnowsze pierwsze. Każdy jest pokazany w najlepszej kompresji, jaką karta może pomieścić..

  1. 01 Ring-mini-linear-2.0 16.4B · Q3_K_M · Oct 2025 17.2 tok/s
  2. 02 Ling-mini-base-2.0-20T 16B · Q3_K_M · Sep 2025 17.6 tok/s
  3. 03 Ling-lite-1.5 ("Bailing") 16.8B · Q3_K_M · Mar 2025 16.8 tok/s
  4. 04 Nanbeige2-16B-Chat 15.8B · Q3_K_M · May 2024 17.9 tok/s
  5. 05 DeepSeekMoE-16B 16B · Q3_K_M · Jan 2024 98.0 tok/s
  6. 06 Nanbeige-16B 16B · Q3_K_M · Nov 2023 17.6 tok/s
  7. 07 CodeT5+ 16B · Q3_K_M · May 2023 17.6 tok/s
  8. 08 CodeGen2 16B · Q3_K_M · May 2023 17.6 tok/s
  9. 09 MOSS-Moon-003 16B · Q3_K_M · Apr 2023 17.6 tok/s
  10. 10 CodeGen-Mono 16.1B 16.1B · Q3_K_M · Feb 2023 17.5 tok/s

Najbardziej zaawansowane modele AI na rynku Arc B570

Gdzie ta karta najszybciej produkuje tokeny. Mniejsze modele dominują tutaj, ponieważ generowanie każdego tokena oznacza odczytanie całego modelu z pamięci jednorazowo..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 105 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 105 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 105 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 105 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 105 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 105 tok/s
  7. 07 DeepSeekMoE-16B 16B · Q3_K_M · 8.1 GB 98.0 tok/s
  8. 08 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 96.9 tok/s
  9. 09 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 95.1 tok/s
  10. 10 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 95.1 tok/s

Krok po kroku

Jak obliczyć tokeny na sekundę z a Arc B570

Nie musisz nic obliczać ręcznie — kalkulator na stronie gputps.com już to wyliczył dla każdego modelu, który ta karta może obsługiwać. Odczytanie odpowiedzi zajmuje sześć kroków.

  1. 01

    Zacznij od modelu, a nie od specyfikacji

    Każdy z 381 modeli, które obsługuje Arc B570, znajduje się w tabeli powyżej. Wyszukiwanie zawęża je według nazwy lub rozmiaru.

  2. 02

    Ustaw długość kontekstu, którą faktycznie będziesz używać

    Dłuższe rozmowy kosztują pamięć oprócz wag. Z 10 GB do wykorzystania, to często różnica między modelem, który się mieści, a tym, który się nie mieści.

  3. 03

    Przypnij porównanie do jednego poziomu jakości

    Kompresja to to, co pozwala większym modelom się zmieścić. Kontrola jakości odrzuca każdy model, który potrzebuje więcej niż jesteś skłonny dać.

  4. 04

    Przeczytaj prędkość i zasięg

    Figury są obliczane, a nie mierzone. 105 tok/s na Gemma 3 QAT 1B to najszybszy wynik na tej karcie, a jak każdy wiersz, niesie ze sobą zakres, który odzwierciedla, jak bardzo czas wykonywania ma znaczenie.

  5. 05

    Sprawdź wolną przestrzeń przed podjęciem decyzji

    Porównaj, co każdy model potrzebuje z 10 GB, które ta karta zapewnia. "Tight" oznacza, że działa dzisiaj; "comfortable" oznacza, że nadal działa, gdy rozmowa się rozwija.

  6. 06

    Sprawdź ten sam model z drugiej strony

    Każda nazwa modelu w tabeli prowadzi do swojej własnej strony, która wykonuje te same obliczenia na każdej karcie, którą posiadamy. To jest miejsce, w którym widzisz, czy Arc B570 jest odpowiednim zakupem, czy tylko kartą, która pasuje.

Odpowiedzi

Arc B570 — Często zadawane pytania

01

Czy Arc B570 może uruchomić model 7B?

Tak. Na przykład Arc B570 uruchamia DeepSeek Coder 6.7B w Q4_K_M, używając około 8.3 GB pamięci i generując około 36.1 tokenów na sekundę.

02

Czy Arc B570 może uruchomić model 13B?

Tak. Na przykład Arc B570 uruchamia DeepSeekMoE-16B na Q3_K_M, używając około 8,1 GB pamięci i generując około 98,0 tokenów na sekundę.

03

Ile pamięci ma Arc B570?

A Arc B570 ma 10 GB pamięci GDDR6. Około jednej dziesiątej z tego jest zarezerwowane przez czas działania wnioskowania i sterownik, pozostawiając około 9 GB dostępnych dla modelu i jego rozmowy.

04

Jaka jest przepustowość pamięci karty Arc B570?

Arc B570 ma 380 GB/s przepustowości pamięci, przez 160-bitową magistralę pamięci. To jest najlepszy pojedynczy wskaźnik tego, jak szybko generuje tekst, ponieważ produkcja każdego tokena oznacza odczytanie całego modelu z pamięci raz.

05

Jakiego typu pamięci używa Arc B570?

Używa GDDR6 o taktowaniu 2.38 GHz. Typy HBM znajdują się w akceleratorach centrów danych i mają znacznie większą przepustowość niż GDDR używane w kartach komputerowych, co jest powodem, dla którego generują tokeny znacznie szybciej przy tej samej pojemności.

06

Kto produkuje Arc B570?

Arc B570 jest produktem Intel, z chipem wyprodukowanym przez TSMC, w procesie 5 nm.

07

Kiedy został wydany Arc B570?

Arc B570 został wydany w styczniu 2025 roku.

08

Ile mocy zużywa Arc B570?

Arc B570 ma moc nominalną płyty 150 W, a sugerowana moc zasilacza systemowego to 450 W. Generowanie tekstu zużywa zasoby intensywnie podczas skoków i pozostaje w stanie spoczynku pomiędzy żądaniami, więc średnie zużycie podczas sesji roboczej jest zazwyczaj znacznie poniżej wartości nominalnej.

09

Ile pamięci podręcznej ma Arc B570?

Arc B570 ma 250 KB pamięci podręcznej L1 i 18 MB pamięci podręcznej L2. Pamięć podręczna absorbuje część ruchu pamięci, który w przeciwnym razie trafiłby na główną magistralę, więc większa L2 daje umiarkowany wzrost prędkości generacji ponad to, co sam przepustowość przewiduje.

10

Jakie są TFLOPS karty Arc B570?

Arc B570 ma ocenę na 23 TFLOPS przy połowicznej precyzji i 11,5 TFLOPS przy pojedynczej precyzji. To są szczytowe limity arytmetyczne, a nie osiągalne stawki, a generacja tekstu osiąga tylko małą ich część, ponieważ jest ograniczona przez przepustowość pamięci.

11

Czy Arc B570 obsługuje CUDA?

Nie. CUDA jest wyłącznie dla NVIDIA, a Arc B570 to karta Intel. Uruchamia modele językowe za pomocą ROCm, Vulkan lub Metal w zależności od oprogramowania, które są mniej dojrzałe niż ścieżka CUDA — nasze szacunki nakładają na to karę.

12

Jakie interfejsy busowe wykorzystuje Arc B570?

Używa PCIe 4.0 x8. To reguluje, jak szybko model jest ładowany na kartę, a nie jak szybko działa po załadowaniu, więc kosztuje kilka sekund przy uruchamianiu i nic podczas generacji.

13

Czy Arc B570 jest dobry do uruchamiania lokalnych modeli AI?

Jego pamięć ogranicza go do mniejszych modeli, chociaż jego przepustowość oznacza, że generacja będzie się wydawała wolna na większych modelach. W sumie uruchamia 381 modeli, które śledzimy. Czy to wystarczy, zależy całkowicie od tego, jaki model chcesz — powyższa tabela odpowiada na to bezpośrednio.

14

Czy Arc B570 może uruchomić model, który nie mieści się w jego pamięci?

Może być podzielony, z nadmiarem trzymanym w pamięci systemowej — ale ta część obniża całość, a żaden z 10 GB danych na tej stronie tego nie zakłada.

15

Czy dwie karty Arc B570 będą dwukrotnie szybsze?

Nie. Drugi Arc B570 podwaja pamięć do 20 GB, co pozwala na trzymanie modeli, których żaden z nich nie mógłby pomieścić samodzielnie, ale generacja nie dzieli się w ten sposób. Te liczby opisują jedną kartę.

16

Jakie modele AI może uruchomić Arc B570?

381 z 679 modeli językowych o otwartych wagach, które śledzimy, mieści się na Arc B570 i może być lokalnie uruchamiany na tym urządzeniu. Tabela na tej stronie zawiera każdy z nich, z pamięcią, jakiej potrzebuje, kwantyzacją, na której działa, oraz szacunkową prędkością generacji.

17

Jaki jest największy model AI, który może uruchomić Arc B570?

Największym modelem w naszym katalogu, który pasuje do Arc B570, jest Ling-lite-1.5 ("Bailing") z 16,8 miliardami parametrów, skompresowanym do Q3_K_M. Generuje około 16,8 tokenów na sekundę i potrzebuje około 8,9 GB pamięci karty.

18

Ile tokenów na sekundę generuje Arc B570?

To zależy od modelu. Na Arc B570 najszybszym modelem, który śledzimy, jest Gemma 3 QAT 1B z prędkością około 105 tokenów na sekundę, podczas gdy większe modele działają proporcjonalnie wolniej, ponieważ każdy token wymaga odczytania całego modelu z pamięci za każdym razem. Prędkości są szacunkowe dla jednej rozmowy na raz.

W innym kierunku

Patrząc na to z drugiej strony?

Ta strona zaczyna się od sprzętu. Jeśli już wiesz, jaki model chcesz i chcesz wiedzieć, co jest potrzebne, aby go uruchomić, rozpocznij od modelu zamiast tego.

Wszystkie GPU