Oblicz TPS dla tego RTX 6000D na lokalnych modelach AI

NVIDIA 84 GB GDDR7 1,570 GB/s March 2025

Każdy model w naszym katalogu oceniany jest na podstawie tego arkusza w kontekście długości i minimalnej jakości, które wybierze Pan/Pani. Prędkość to oszacowanie dla pojedynczego żądania, obliczone na podstawie przepustowości pamięci tego arkusza oraz rozmiaru każdego modelu po kompresji..

Obliczono dla tej karty

609 modele, które może uruchomić

679 modeli w naszym katalogu łącznie

Największy model, który obsługuje

dots.llm1

142B · Q3_K_M · 12.6 tok/s

najszybszy model

Gemma 3 QAT 1B

665 tok/s · 1B

Które modele AI mogą działać na RTX 6000D?

Ustaw wejścia, odczytaj odpowiedź

Więcej kontekstu oznacza więcej pamięci na pamięć podręczną rozmowy. Prędkość dotyczy nowej rozmowy i nie zmienia się w zależności od tego ustawienia.

Ukrywa modele, które zmieściłyby się tylko przy kompresji poniżej tego punktu.

609 modele pasują

Obliczanie
Kwantaizacja Fit
665 tok/s

565–798

Gemma 3 1B 1B Mar 2025 1.8 GB 33k tokeny Q8_0 Wygodny
665 tok/s

565–798

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k tokeny Q8_0 Wygodny
665 tok/s

399–1,064 · niskie zaufanie

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k tokeny ? Q8_0 Wygodny
665 tok/s

399–1,064 · niskie zaufanie

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k tokeny ? Q8_0 Wygodny
665 tok/s

399–1,064 · niskie zaufanie

OLMo-1B 1B Feb 2024 1.8 GB 131k tokeny ? Q8_0 Wygodny
665 tok/s

399–1,064 · niskie zaufanie

Pythia-1b 1B Apr 2023 1.8 GB 131k tokeny ? Q8_0 Wygodny
616 tok/s

369–985 · niskie zaufanie

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k tokeny ? Q8_0 Wygodny
604 tok/s

363–967 · niskie zaufanie

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
604 tok/s

363–967 · niskie zaufanie

SantaCoder 1.1B Jan 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
604 tok/s

363–967 · niskie zaufanie

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
604 tok/s

363–967 · niskie zaufanie

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 Wygodny
554 tok/s

332–887 · niskie zaufanie

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
554 tok/s

332–887 · niskie zaufanie

MinerU2.5 1.2B Sep 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
554 tok/s

332–887 · niskie zaufanie

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k tokeny ? Q8_0 Wygodny
554 tok/s

332–887 · niskie zaufanie

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k tokeny ? Q8_0 Wygodny
541 tok/s

460–649

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k tokeny Q8_0 Wygodny
533 tok/s

320–853 · niskie zaufanie

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

DigiRL 1.3B Jun 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

Otter 1.3B May 2023 2.1 GB 131k tokeny ? Q8_0 Wygodny
511 tok/s

307–818 · niskie zaufanie

Phi-1 1.3B Oct 2023 2.1 GB 131k tokeny ? Q8_0 Wygodny

Prędkości są szacunkowe dla pojedynczego żądania — jednej rozmowy naraz — obliczane na podstawie przepustowości pamięci, rozmiaru modelu i kwantyzacji. Rzeczywista przepustowość zależy od czasu wykonywania inferencji oraz jej wersji. Wyniki publikowane przez dostawców sprzętu mierzą wiele równoczesnych żądań i są znacznie wyższe.

Na nagraniu

RTX 6000D Pełna specyfikacja

Wszystko z zapisów dla tej płyty, uporządkowane według tego, jak bardzo wpływają na uruchomienie modelu językowego, a nie według tego, jak opisuje je karta specyfikacji. Pamięć jest na pierwszym miejscu, ponieważ decyduje o wyniku; reszta to kontekst.

Pamięć

Dwie specyfikacje, które decydują, jakie modele ta karta może uruchomić i jak szybko. Pojemność określa, które modele pasują; przepustowość określa, ile tokenów na sekundę produkują, gdy już to robią.

Rozmiar pamięci
84 GB
Przepustowość pamięci
1,570 GB/s
Typ pamięci
GDDR7
Szerokość magistrali pamięci
448 bit
Takt pamięci
1.75 GHz

Chips

Który procesor znajduje się na płycie i jak został wyprodukowany. Mniejszy rozmiar procesu zazwyczaj oznacza lepszą wydajność przy tym samym zużyciu energii.

Procesor graficzny
GB202
Architektura
Blackwell 2.0
Generacja
Blackwell PRO W(x000)
Foundry
TSMC
Rozmiar procesów
5 nm
Tranzystory
92.2 billion
Gęstość tranzystorów
122,900 K/mm²
Rozmiar die
750 mm²
Wydano
18 March 2025

Częstotliwości zegara

Jak szybko działa procesor. Warto znacznie mniej tutaj niż na benchmarku gier: generowanie tekstu jest ograniczone przepustowością pamięci, więc wyższa częstotliwość ledwie wpływa na wynik.

Bazowe zegary
1.59 GHz
Prędkość boost
2.43 GHz

Jednostki przetwarzające

Co zawiera chip. Te elementy napędzają wydajność grafiki i są istotne głównie dla przetwarzania długiego promptu, a nie dla produkcji odpowiedzi.

Jednostki cieniujące
19,968
Jednostki mapowania tekstur
624
Jednostki wyjściowe renderowania
192
Procesory strumieniowe
156
rdzenie tensorowe
624
Rdzenie ray tracing
156
cache L1
128 KB
L2 pamięć podręczna
128 MB

Teoretyczna wydajność

Szczytowe stawki arytmetyczne opublikowane dla płyty. Są to limity, których żaden rzeczywisty obciążenie nie osiąga, a generowanie tekstu osiąga tylko małą część z nich, ponieważ jest ograniczone przez pamięć, a nie przez obliczenia.

Półprecyzyjność (FP16)
97 TFLOPS
Pojedyncza precyzja (FP32)
97 TFLOPS
Podwójna precyzja (FP64)
1.5 TFLOPS
Wskaźnik pikseli
467 GPixel/s
Wskaźnik tekstury
1,516 GTexel/s

Płyta

Co jest potrzebne do fizycznej instalacji i zasilania karty — praktyczne ograniczenia, które decydują o tym, czy pasuje do maszyny, którą już posiadasz.

Pobór mocy (TDP)
600 W
Zalecany zasilacz
1,000 W
Złącza zasilania
1x 16-pin
Interfejs szyny buseskiej
PCIe 5.0 x16
Szerokość slotu
Dual-slot
Wymiary
304 mm × 40 mm
Wyświetlaj wyniki
4x DisplayPort 2.1b

Wsparcie oprogramowania

Jakie interfejsy graficzne i obliczeniowe obsługuje karta. Zdolność obliczeniowa CUDA jest tą, która ma znaczenie dla wnioskowania: poniżej 7.0 nie ma rdzeni tensorowych, a nowoczesne oprogramowanie do wnioskowania przechodzi na wolniejsze ścieżki kodowe.

CUDA zdolność obliczeniowa
12.0
DirectX
12.2
OpenGL
4.6
Vulkan
1.4
OpenCL
3.0
Model cieniowania
6.8

Wpisy

Gdzie można kupić a RTX 6000D

Obecnie żaden sprzedawca nie oferuje tej karty. Oferty pochodzą od sprzedawców, którzy publikują je tutaj bezpośrednio — przeglądaj katalog dostawców aby zobaczyć, kto sprzedaje co.

Co oznaczają liczby

Pojemność i przepustowość

Pamięć

84 GB

Przepustowość

1,570 GB/s

Największy model

dots.llm1

Z 84 GB GDDR7, RTX 6000D jest w klasie sprzętu, który pomieści największe modele o otwartych wagach bez dzielenia ich na maszyny. Około 75,6 GB z tego jest dostępne dla środowiska uruchomieniowego wnioskowania, gdy sterownik weźmie swoją część.

Pasmo wynosi 1,570 GB/s wzdłuż magistrali 448-bitowej. Generowanie tokenu oznacza odczytanie każdej wagi raz, więc ten wskaźnik ustala tempo bardziej niż jakakolwiek inna liczba tutaj, a na tym poziomie tekst dociera szybciej niż większość ludzi czyta.

Wartość to zegar pamięci - 1,75 GHz tutaj - pomnożona przez szerokość magistrali. To dlatego liczba rdzeni tak słabo przewiduje prędkość generacji.

W praktyce ta kombinacja osiąga maksimum na dots.llm1 — 142B, skompresowane do Q3_K_M, generując około 12,6 tokenów na sekundę.

Chip i jak został zbudowany

RTX 6000D jest zbudowany na procesorze graficznym GB202, wykorzystując architekturę Blackwell 2.0 firmy NVIDIA, jako część generacji Blackwell PRO W(x000).

Chip jest produkowany przez TSMC, w procesie 5 nm, z układem o wymiarach 750 mm², zawierającym 92,2 miliarda tranzystorów. Mniejszy proces zazwyczaj oznacza lepszą wydajność przy tej samej mocy, chociaż w przypadku modeli językowych ma to znacznie mniejsze znaczenie niż subsystem pamięci.

Został wydany w marcu 2025 roku, około 1 rok temu. Wsparcie oprogramowania do inferencji zazwyczaj podąża za sprzętem o rok lub dwa, więc karta z tego okresu zazwyczaj ma dostępne dojrzałe, dobrze zoptymalizowane ścieżki kodu.

Przepustowość obliczeniowa i dlaczego ma mniejsze znaczenie, niż się wydaje

FP16

97 TFLOPS

FP64

1.5 TFLOPS

rdzenie tensorowe

624

Na papierze RTX 6000D osiąga 97 TFLOPS przy półprecyzji i 97 TFLOPS przy precyzji pojedynczej. To są wartości szczytowe, których żaden rzeczywisty obciążenie nie utrzymuje, a generowanie tekstu osiąga tylko niewielką ich część — dekodowanie jest ograniczone przez pamięć, a nie przez arytmetykę, co sprawia, że karta może wyglądać na niezwykle potężną tutaj i nadal produkować tokeny w zwykłym tempie.

Przepustowość podwójnej precyzji wynosi 1,5 TFLOPS. Nie ma to wpływu na uruchamianie modelu językowego - żaden czas wykonywania inferencji go nie wykorzystuje - ale oddziela części centrum danych od konsumenckich, ponieważ te ostatnie celowo to ograniczają.

Karta ma 624 rdzenie tensorowe rozlokowane w 156 multiprocesorach strumieniowych. Przyspieszają one arytmetykę macierzy, która jest sercem transformera, i to one sprawiają, że przetwarzanie zapytań — czytanie długiego dokumentu przed odpowiedzią — jest dramatycznie szybsze, niż byłoby w przeciwnym razie.

Zegary działają od 1,59 GHz w podstawie do 2,43 GHz po podkręceniu. Warto tu znacznie mniej niż na benchmarku gier: zwiększenie prędkości zegara przyspiesza obliczenia, a obliczenia to nie to, na co czeka generacja.

Cache i jednostki przetwarzania

RTX 6000D ma 128 KB pamięci podręcznej L1, wspieranej przez 128 MB L2. Pamięć podręczna absorbuje część ruchu pamięci, który w przeciwnym razie uderzyłby w główny szereg, co jest jedynym miejscem na tej stronie, gdzie liczba inna niż przepustowość cicho wpływa na prędkość generacji — duża L2 pozwala większej części zbioru roboczego pozostać blisko rdzeni.

Jest 19,968 jednostek cieniowania, 624 jednostki mapowania tekstur i 192 jednostki wyjściowe renderowania. Te jednostki obsługują obciążenia graficzne i przyczyniają się do przetwarzania poleceń, ale przez większość czasu, który model spędza na generowaniu odpowiedzi, pozostają bezczynne.

Moc, rozmiar i instalacja

Pobór mocy

600 W

RTX 6000D jest oceniana na 600 W, z zasilaczem o mocy 1 000 W sugerowanym dla całego systemu. Uruchamianie modelu językowego obciąża kartę w krótkich okresach, a nie ciągle — zużywa dużo mocy podczas generowania i ma przestoje między żądaniami — więc stałe zużycie w ciągu dnia roboczego jest zwykle znacznie poniżej podanej wartości.

Płyta zajmuje podwójny slot, ma długość 304 mm i wymaga 1x 16-pin. Warto sprawdzić w odniesieniu do obudowy i zasilacza już w maszynie, ponieważ największe karty potrzebują zdecydowanie więcej zarówno jednego, jak i drugiego niż typowy komputer stacjonarny.

Łączy się przez PCIe 5.0 x16. Interfejs decyduje, jak szybko model jest ładowany z dysku do karty, a nie jak szybko działa po załadowaniu, więc węższe połączenie kosztuje kilka sekund przy uruchamianiu, a później już nic.

Ekstrema

Największe modele AI, które uruchamiają się na RTX 6000D

Największe modele o otwartych wagach, które mieszczą się na tej karcie, najnowsze pierwsze. Każdy jest pokazany w najlepszej kompresji, jaką karta może pomieścić..

  1. 01 Mistral Medium 3.5 128B · IQ4_XS · Apr 2026 12.8 tok/s
  2. 02 dots.llm1 142B · Q3_K_M · Jul 2025 12.6 tok/s
  3. 03 Pixtral Large 124B · IQ4_XS · Nov 2024 13.2 tok/s
  4. 04 xLAM-8x22B 141B · Q3_K_M · Sep 2024 12.7 tok/s
  5. 05 SaulLM-large 141B · Q3_K_M · Jul 2024 12.7 tok/s
  6. 06 Mixtral 8x22B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  7. 07 WizardLM-2 8x22B 141B · Q3_K_M · Apr 2024 12.7 tok/s
  8. 08 Zephyr 141B-A39B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  9. 09 APUS-xDAN-4.0(MoE) 136B · IQ4_XS · Apr 2024 12.0 tok/s
  10. 10 DBRX 132B · IQ4_XS · Mar 2024 45.4 tok/s

Najbardziej zaawansowane modele AI na rynku RTX 6000D

Gdzie ta karta najszybciej produkuje tokeny. Mniejsze modele dominują tutaj, ponieważ generowanie każdego tokena oznacza odczytanie całego modelu z pamięci jednorazowo..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 665 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 665 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 665 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 616 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 604 tok/s

Krok po kroku

Jak obliczyć tokeny na sekundę z a RTX 6000D

Nie musisz nic obliczać ręcznie — kalkulator na stronie gputps.com już to wyliczył dla każdego modelu, który ta karta może obsługiwać. Odczytanie odpowiedzi zajmuje sześć kroków.

  1. 01

    Szukaj modelu, którego chcesz

    Tabela zawiera 609 modeli, które ten RTX 6000D może uruchomić. Szukaj według nazwy lub według rozmiaru — wpisanie 27b pasuje do liczby parametrów, nawet gdy nazwa nigdy tego nie wskazuje.

  2. 02

    Dopasuj kontekst do swojej pracy

    Dłuższe rozmowy kosztują pamięć oprócz wag. Z 84 GB do dyspozycji, to często różnica między tym, czy model się mieści, a nie.

  3. 03

    Przypnij porównanie do jednego poziomu jakości

    Domyślnie tabela wybiera najmniej skompresowaną kopię, która pasuje. Ustawienie minimalnej wartości usuwa modele, które kwalifikują się tylko dzięki dużej kompresji.

  4. 04

    Przeczytaj prędkość i zasięg

    Każda prędkość jest oszacowaniem dla pojedynczej rozmowy, z zakresami poniżej niej — 665 tok/s na Gemma 3 QAT 1B na górnym końcu. Ta sama karta i model różnią się o trzydzieści do pięćdziesięciu procent między czasami inferencji.

  5. 05

    Sprawdź wolną przestrzeń przed podjęciem decyzji

    Kolumna dopasowania oddziela modele, które tylko pasują, od tych z zapasem — warto sprawdzić w stosunku do karty 84 GB, zanim zdecydujesz się na jeden.

  6. 06

    Sprawdź ten sam model z drugiej strony

    Każda strona modelu powtarza to obliczenie dla całego katalogu. Warto zobaczyć przed podjęciem decyzji: pokazuje, co jeszcze uruchamia ten sam model i jak wypada RTX 6000D.

Odpowiedzi

RTX 6000D — Często zadawane pytania

01

Jaka jest szerokość pasma pamięci RTX 6000D?

RTX 6000D ma 1,570 GB/s przepustowości pamięci, na szynie pamięci 448-bitowej. To jest jedyny najlepszy wskaźnik tego, jak szybko generuje tekst, ponieważ produkcja każdego tokena oznacza odczytanie całego modelu z pamięci jednorazowo.

02

Jaki typ pamięci wykorzystuje RTX 6000D?

Używa GDDR7 taktowanego na 1,75 GHz. Typy HBM znajdują się w akceleratorach centrum danych i mają znacznie większą przepustowość niż GDDR używanego w kartach desktopowych, co sprawia, że generują tokeny znacznie szybciej przy tej samej pojemności.

03

Kto produkuje RTX 6000D?

RTX 6000D to produkt NVIDIA, z chipem produkowanym przez TSMC, w procesie 5 nm.

04

Kiedy został wydany RTX 6000D?

RTX 6000D został wydany w marcu 2025 roku.

05

Ile mocy zużywa RTX 6000D?

Karta RTX 6000D ma nominalną moc na poziomie 600 W, a zaleca się zasilacz systemowy o mocy 1 000 W. Generowanie tekstu zużywa dużo mocy w krótkich chwilach, a między żądaniami działa w trybie bezczynności, więc średnie zużycie podczas sesji roboczej jest zazwyczaj znacznie poniżej wartości nominalnej.

06

Ile pamięci cache ma RTX 6000D?

RTX 6000D ma 128 KB pamięci podręcznej L1 i 128 MB pamięci podręcznej L2. Pamięć podręczna absorbuje część ruchu pamięci, który w przeciwnym razie dotarłby do głównej magistrali, więc większe L2 daje skromny wzrost prędkości generacji ponad to, co przewiduje sama przepustowość.

07

Jakie są TFLOPS RTX 6000D?

RTX 6000D ma ocenę 97 TFLOPS przy półprecyzji i 97 TFLOPS przy precyzji pojedynczej. To są szczytowe limity arytmetyczne, a nie osiągalne prędkości, a generacja tekstu osiąga tylko małą część z nich, ponieważ jest ograniczona przez przepustowość pamięci.

08

Ile rdzeni tensorowych ma RTX 6000D?

RTX 6000D ma 624 rdzenie tensorowe w 156 multiprocesorach strumieniowych. Przyspieszają one arytmetykę macierzową, z której zbudowany jest transformator, co głównie przyspiesza przetwarzanie długiego zapytania, a nie generowanie odpowiedzi.

09

Czy RTX 6000D obsługuje CUDA?

Tak. RTX 6000D zgłasza zdolność obliczeniową CUDA 12.0. Zdolności 7.0 i wyższe mają rdzenie tensorowe, które wykorzystuje nowoczesne oprogramowanie do wnioskowania; poniżej tego wraca do wolniejszych ścieżek kodu dla skwantyzowanych modeli.

10

Jakiego interfejsu autobusowego używa RTX 6000D?

Używa PCIe 5.0 x16. To decyduje o tym, jak szybko model jest ładowany na kartę, a nie jak szybko działa po załadowaniu, więc kosztuje to kilka sekund przy uruchomieniu i nic podczas generowania.

11

Czy RTX 6000D jest dobry do uruchamiania lokalnych modeli AI?

Jego pamięć jest wystarczająco duża dla modeli, do których większość sprzętu biurkowego nie ma dostępu, a jego przepustowość jest wystarczająco wysoka, aby generować tekst szybciej niż większość ludzi czyta. W sumie uruchamia 609 modeli, które śledzimy. Czy to wystarczy, zależy całkowicie od tego, który model chcesz — powyższa tabela odpowiada na to bezpośrednio.

12

Czy RTX 6000D może uruchomić model, który nie mieści się w jego pamięci?

Zrzucenie ponad 84 GB karty jest możliwe i zazwyczaj jest fałszywą oszczędnością: część pamięci systemowej jest wystarczająco wolna, aby zdominować wynik.

13

Czy dwie karty RTX 6000D byłyby dwa razy szybsze?

Sparowanie kart RTX 6000D kupuje zapas zamiast tempa: 168 GB połączonej pamięci, przy mniej więcej tej samej prędkości generacji co jedna.

14

Jakie modele AI może uruchomić RTX 6000D?

609 z 679 otwartych modeli językowych, które śledzimy, mieści się na RTX 6000D i można je uruchomić lokalnie na nim. Tabela na tej stronie wymienia każdy z nich, z pamięcią, jakiej potrzebuje, kwantyzacją, na której działa, oraz szacunkową prędkością generacji.

15

Jaki jest największy model AI, który może uruchomić RTX 6000D?

Największy model w naszym katalogu, który mieści się na RTX 6000D, to dots.llm1 o 142B parametrach, skompresowany do Q3_K_M. Generuje około 12,6 tokenów na sekundę i potrzebuje około 70,1 GB pamięci karty.

16

Ile tokenów na sekundę produkuje RTX 6000D?

To zależy od modelu. Na RTX 6000D najszybszym modelem, który śledzimy, jest Gemma 3 QAT 1B z prędkością około 665 tokenów na sekundę, podczas gdy większe modele działają proporcjonalnie wolniej, ponieważ każdy token wymaga odczytania całego modelu z pamięci za każdym razem. Prędkości są szacunkowe dla pojedynczej rozmowy w danym czasie.

17

Czy RTX 6000D może uruchomić model 7B?

Tak. Na przykład RTX 6000D uruchamia Multi-Token Prediction 7B przy Q8_0, używając około 7,9 GB pamięci i generując około 99,2 tokenów na sekundę.

18

Czy RTX 6000D może uruchomić model 13B?

Tak. Na przykład RTX 6000D uruchamia DeepSeekMoE-16B w Q8_0, używając około 17,5 GB pamięci i generując około 231 tokenów na sekundę.

19

Czy RTX 6000D może uruchomić model 30B?

Tak. Na przykład RTX 6000D uruchamia ERNIE-4.5-VL-28B-A3B na Q8_0, używając około 29,2 GB pamięci i generując około 132 tokeny na sekundę.

20

Czy RTX 6000D może uruchomić model 70B?

Tak. Na przykład RTX 6000D uruchamia Qwen3-Coder-Next na Q6_K, używając około 62.0 GB pamięci i generując około 67.1 tokenów na sekundę.

21

Ile pamięci ma RTX 6000D?

RTX 6000D ma 84 GB pamięci GDDR7. Około jednej dziesiątej z tego jest zarezerwowane przez czas wykonywania wniosków i sterownik, pozostawiając około 75,6 GB dostępne dla modelu i jego rozmowy.

W innym kierunku

Patrząc na to z drugiej strony?

Ta strona zaczyna się od sprzętu. Jeśli już wiesz, jaki model chcesz i chcesz wiedzieć, co jest potrzebne, aby go uruchomić, rozpocznij od modelu zamiast tego.

Wszystkie GPU