Spočítejte TPS modelu RTX 6000D o místních AI modelech

NVIDIA 84 GB GDDR7 1,570 GB/s March 2025

Každý model v našem katalogu je hodnocen podle této karty s ohledem na délku kontextu a požadovanou minimální kvalitu, kterou si zvolíte. Rychlost je odhad pro jedno požadavek, vypočtený na základě šířky pásma paměti této karty a velikosti každého modelu po kompresi..

Vypočteno pro tuto kartu

609 modely, které může spustit

679 modely v našem katalogu dohromady

Největší model, který dokáže zvládnout

dots.llm1

142B · Q3_K_M · 12.6 tok/s

Nejrychlejší model

Gemma 3 QAT 1B

665 tok/s · 1B

Které AI modely lze spustit na RTX 6000D?

Nastavte vstupy, přečtěte odpověď

Více kontextu znamená více paměti pro mezipaměť konverzace. Rychlost je určena pro novou konverzaci a s tímto nastavením se nemění.

skrývá modely, které by se vešly pouze při kompresi pod tímto bodem.

609 modely odpovídají

Výpočet
Kvantizace Vhodné
665 tok/s

565–798

Gemma 3 1B 1B Mar 2025 1.8 GB 33k tokeny Q8_0 pohodlné
665 tok/s

565–798

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k tokeny Q8_0 pohodlné
665 tok/s

399–1,064 · nízká důvěryhodnost

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k tokeny ? Q8_0 pohodlné
665 tok/s

399–1,064 · nízká důvěryhodnost

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k tokeny ? Q8_0 pohodlné
665 tok/s

399–1,064 · nízká důvěryhodnost

OLMo-1B 1B Feb 2024 1.8 GB 131k tokeny ? Q8_0 pohodlné
665 tok/s

399–1,064 · nízká důvěryhodnost

Pythia-1b 1B Apr 2023 1.8 GB 131k tokeny ? Q8_0 pohodlné
616 tok/s

369–985 · nízká důvěryhodnost

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k tokeny ? Q8_0 pohodlné
604 tok/s

363–967 · nízká důvěryhodnost

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k tokeny ? Q8_0 pohodlné
604 tok/s

363–967 · nízká důvěryhodnost

SantaCoder 1.1B Jan 2023 1.9 GB 131k tokeny ? Q8_0 pohodlné
604 tok/s

363–967 · nízká důvěryhodnost

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 pohodlné
604 tok/s

363–967 · nízká důvěryhodnost

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokeny ? Q8_0 pohodlné
554 tok/s

332–887 · nízká důvěryhodnost

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k tokeny ? Q8_0 pohodlné
554 tok/s

332–887 · nízká důvěryhodnost

MinerU2.5 1.2B Sep 2025 2.0 GB 131k tokeny ? Q8_0 pohodlné
554 tok/s

332–887 · nízká důvěryhodnost

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k tokeny ? Q8_0 pohodlné
554 tok/s

332–887 · nízká důvěryhodnost

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k tokeny ? Q8_0 pohodlné
541 tok/s

460–649

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 131k tokeny Q8_0 pohodlné
533 tok/s

320–853 · nízká důvěryhodnost

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

DigiRL 1.3B Jun 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

Otter 1.3B May 2023 2.1 GB 131k tokeny ? Q8_0 pohodlné
511 tok/s

307–818 · nízká důvěryhodnost

Phi-1 1.3B Oct 2023 2.1 GB 131k tokeny ? Q8_0 pohodlné

Rychlosti jsou odhady pro jedinou žádost — jednu konverzaci najednou — vypočtené z paměťové šířky pásma, velikosti modelu a kvantizace. Skutečný průtok se liší v závislosti na době inference a její verzi. Čísla publikovaná výrobci hardware měří mnoho současných žádostí a jsou mnohem vyšší.

Záznam.

RTX 6000D Plná specifikace

Všechno zaznamenané na této desce, seřazené podle toho, jak moc ovlivňuje běh jazykového modelu, nikoli podle toho, jak by to uvedla specifikace. Paměť přichází jako první, protože rozhoduje o výsledku; zbytek je kontext..

Paměť

Dva specifikace, které rozhodují, co tato karta může spustit a jak rychle. Kapacita určuje, které modely se vejdou; šířka pásma určuje, kolik tokenů za sekundu vyprodukují, jakmile to udělají.

Velikost paměti
84 GB
Šířka pásma paměti
1,570 GB/s
Typ paměti
GDDR7
Šířka paměťové sběrnice
448 bit
Paměťový takt
1.75 GHz

Čip

Který procesor je na desce a jak byl vyroben. Menší velikost technologického procesu obvykle znamená vyšší výkon při stejné spotřebě energie.

Grafický procesor
GB202
Architektura
Blackwell 2.0
Generace
Blackwell PRO W(x000)
Foundry
TSMC
Velikost procesu
5 nm
Tranzistory
92.2 billion
Hustota tranzistorů
122,900 K/mm²
Velikost模型
750 mm²
Vydáno
18 March 2025

Frekvence hodin

Jak rychle procesor běží. Tady má mnohem menší hodnotu než na herním benchmarku: generování textu je omezeno šířkou pásma paměti, takže vyšší takt téměř neposune výsledek.

Základní frekvence
1.59 GHz
Zvýšení taktovací frekvence
2.43 GHz

Zpracovací jednotky

Co čip obsahuje. Tyto ovlivňují výkon grafiky a mají hlavní význam pro zpracování dlouhého příkazu spíše než pro produkci odpovědi.

Stínovací jednotky
19,968
Jednotky texturového mapování
624
Jednotky výstupu renderování
192
Streaming multiprocessory
156
Tensor jádra
624
Jádra ray tracing
156
L1 cache
128 KB
L2 vyrovnávací paměť
128 MB

Teoretický výkon

Špičkové aritmetické rychlosti publikované pro desku. To jsou stropy, které žádné skutečné zatížení nedosahuje, a generování textu dosahuje pouze malé části z nich, protože je omezeno pamětí spíše než aritmetikou.

Poloviční přesnost (FP16)
97 TFLOPS
Jednoduchá přesnost (FP32)
97 TFLOPS
Dvojitá přesnost (FP64)
1.5 TFLOPS
Frekvence pixelů
467 GPixel/s
Míra textury
1,516 GTexel/s

Deska

Co je potřeba k fyzické instalaci a napájení karty — praktické omezení, která rozhodují, zda se vejde do stroje, který již vlastníte.

Příkon (TDP)
600 W
Navrhovaný zdroj napájení
1,000 W
Konektory napájení
1x 16-pin
Rozhraní sběrnice
PCIe 5.0 x16
Šířka slotu
Dual-slot
Rozměry
304 mm × 40 mm
Zobrazit výstupy
4x DisplayPort 2.1b

Podpora softwaru

Jaké grafické a výpočetní rozhraní karta podporuje. CUDA výpočetní schopnost je ta, která se týká inferencí: pod 7.0 nejsou žádné tensorové jádra a moderní inferenční software se vrací k pomalejším kódovým cestám.

CUDA výpočetní schopnost
12.0
DirectX
12.2
OpenGL
4.6
Vulkan
1.4
OpenCL
3.0
Shader model
6.8

Záznamy

Kde koupit a RTX 6000D

Žádný prodejce momentálně tento karty nenabízí. Nabídky pocházejí od prodejců, kteří je zde přímo zveřejňují. — procházet adresář dodavatelů vidět, kdo prodává co.

Co čísla znamenají

Kapacita a šířka pásma

Paměť

84 GB

Šířka pásma

1,570 GB/s

Největší model

dots.llm1

S 84 GB GDDR7 je RTX 6000D ve třídě hardwaru, která zvládá největší modely s otevřenou váhou bez jejich rozdělení mezi stroje. Přibližně 75,6 GB z toho je přístupných inference runtime poté, co ovladač vezme svou část.

Šířka pásma je 1,570 GB/s přes 448-bitovou sběrnici. Generování tokenu znamená přečtení každé váhy jednou, takže toto číslo určuje tempo více než jakékoli jiné číslo zde, a na této úrovni text přichází rychleji, než většina lidí čte.

Číslo je paměťové hodiny — 1,75 GHz zde — násobené šířkou sběrnice. Je to důvod, proč počty jader tak špatně predikují rychlost generace.

V praxi tato kombinace dosahuje maximální hodnoty na dots.llm1 — 142B, komprimována na Q3_K_M, generující přibližně 12,6 tokenů za sekundu.

Čip a jak byl postaven

RTX 6000D je postaven na grafickém procesoru GB202, využívající architekturu Blackwell 2.0 od NVIDIA, jako součást generace Blackwell PRO W(x000).

Čip vyrábí TSMC, na procesu 5 nm, s čipem o rozměrech 750 mm², obsahujícím 92,2 miliardy tranzistorů. Menší proces obecně znamená vyšší výkon při stejné spotřebě, avšak pro jazykové modely to má mnohem menší význam než paměťový subsystém.

Bylo to vydáno v březnu 2025, přibližně před 1 rokem. Podpora inferenčního softwaru obvykle následuje hardware o rok nebo dva, takže karta tohoto stáří má obvykle k dispozici vyzrálé, dobře optimalizované cesty kódu.

Provozní propustnost a proč je méně důležitá, než to vypadá

FP16

97 TFLOPS

FP64

1.5 TFLOPS

Tensor jádra

624

Na papíře RTX 6000D dosahuje 97 TFLOPS při poloviční přesnosti a 97 TFLOPS při jednoduché přesnosti. Toto jsou vrcholné hodnoty, které žádné skutečné zatížení neudržuje, a generování textu dosahuje pouze malé části z nich — dekódování je omezeno pamětí spíše než aritmetikou, což je důvod, proč může karta zde vypadat nesmírně výkonně a přesto produkovat tokeny v obyčejné rychlosti.

Dvojitá přesnost propustnosti je 1,5 TFLOPS. Nemá to žádný vliv na běh jazykového modelu — žádný inference runtime to nepoužívá — ale odděluje části datového centra od spotřebitelských, protože ty druhé to úmyslně omezují.

Karta obsahuje 624 tensorových jader napříč 156 streamovacími multiprocesory. Tyto akcelerují maticovou aritmetiku, která je srdcem transformátoru, a právě díky nim je zpracování promptu — čtení dlouhého dokumentu před odpovědí — dramaticky rychlejší, než by jinak bylo.

Hodiny běží od 1,59 GHz při základním taktu až do 2,43 GHz při zvýšeném taktu. V tuto chvíli mají výrazně nižší hodnotu než na herních benchmarkích: zvyšování taktu zrychluje aritmetiku, a aritmetika není to, na co generace čeká.

Cache a výpočetní jednotky

RTX 6000D má 128 KB L1 cache, podpořenou 128 MB L2. Cache pohlcuje část paměťového provozu, který by jinak zasáhl hlavní sběrnici, což je jediné místo na této stránce, kde jiné číslo než šířka pásma tiše ovlivňuje rychlost generování — velké L2 umožňuje udržet více pracovního souboru blízko jader.

Je zde 19,968 stínovacích jednotek, 624 jednotek pro mapování textur a 192 jednotek pro výstup vykreslování. Tyto jedou grafické úlohy a přispívají k rychlému zpracování, ale většinu času, který model tráví generováním odpovědi, zůstávají nevyužité.

Výkon, velikost a instalace

Příkon

600 W

RTX 6000D má výkon 600 W, přičemž pro celý systém se doporučuje napájecí zdroj o výkonu 1 000 W. Spouštění jazykového modelu zaměstnává kartu v přerušovaných intervalech spíše než nepřetržitě — čerpá energii při generování a nečinní mezi požadavky — takže dlouhodobé čerpání během pracovního dne je obvykle výrazně pod uvedeným číslem.

Deska zaujímá dvojslot, měří 304 mm na délku a potřebuje 1x 16-pin. Stojí za to zkontrolovat proti skříni a napájecímu zdroji, které již jsou v zařízení, protože největší karty potřebují výrazně více obojího než typický desktop nabízí.

Spojuje se přes PCIe 5.0 x16. Rozhraní určuje, jak rychle se model načte z disku do karty, nikoli jak rychle běží poté, co je tam, takže užší spojení stojí v úvodu několik sekund a poté nic.

Extrémy

Největší AI modely, které běží na RTX 6000D

Největší modely s otevřenou váhou, které se vejdou na tuto kartu, nejnovější první. Každý je zobrazen v nejlepší kompresi, kterou karta může držet..

  1. 01 Mistral Medium 3.5 128B · IQ4_XS · Apr 2026 12.8 tok/s
  2. 02 dots.llm1 142B · Q3_K_M · Jul 2025 12.6 tok/s
  3. 03 Pixtral Large 124B · IQ4_XS · Nov 2024 13.2 tok/s
  4. 04 xLAM-8x22B 141B · Q3_K_M · Sep 2024 12.7 tok/s
  5. 05 SaulLM-large 141B · Q3_K_M · Jul 2024 12.7 tok/s
  6. 06 Mixtral 8x22B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  7. 07 WizardLM-2 8x22B 141B · Q3_K_M · Apr 2024 12.7 tok/s
  8. 08 Zephyr 141B-A39B 141B · Q3_K_M · Apr 2024 46.0 tok/s
  9. 09 APUS-xDAN-4.0(MoE) 136B · IQ4_XS · Apr 2024 12.0 tok/s
  10. 10 DBRX 132B · IQ4_XS · Mar 2024 45.4 tok/s

Nejrychlejší AI modely na RTX 6000D

Kde tato karta produkuje tokeny nejrychleji. Menší modely zde dominují, protože generování každého tokenu znamená načíst celý model z paměti jednou..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 665 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 665 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 665 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 665 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 616 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 604 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 604 tok/s

krok za krokem

Jak spočítat počet tokenů za sekundu u a RTX 6000D

Nemusíte nic počítat ručně — kalkulačka na gputps.com na této stránce již vypočítala pro každý model, který tato karta může držet. Získání odpovědi vyžaduje šest kroků.

  1. 01

    Hledejte model, který chcete

    Tabulka uvádí 609 modelů, které může RTX 6000D spustit. Hledejte podle názvu nebo podle velikosti — zadání 27b odpovídá na počet parametrů, i když název to nikdy neuvádí.

  2. 02

    Přizpůsobte kontext svému pracovnímu nasazení

    Delší konverzace stojí paměť navíc k váhám. S 84 GB k dispozici je to často rozdíl mezi modelem, který se vejde, a tím, který se nevejde.

  3. 03

    Přiřaďte srovnání k jedné kvalitativní úrovni

    Ve výchozím nastavení tabulka vybírá nejméně komprimovanou kopii, která se vejde. Nastavení podlahy odstraňuje modely, které splňují kritéria pouze díky silné kompresi.

  4. 04

    Přečtěte si rychlost a dosah

    Každá rychlost je odhad pro jedinou konverzaci, s rozsahem pod ní — 665 tok/s na Gemma 3 QAT 1B na vrcholu zde. Ta samá karta a model se liší o třicet až padesát procent mezi běhy inference.

  5. 05

    Zkontrolujte prostor před tím, než se rozhodnete

    Sloupec vhodnosti odděluje modely, které se právě vejdou, od těch, které mají ještě prostor navíc - stojí za to ověřit s kartou 84 GB, než se rozhodnete pro jeden.

  6. 06

    Zkontrolujte stejný model z druhé strany

    Každá stránka modelu opakuje tento výpočet pro celý katalog. Stojí za to se podívat před rozhodnutím: ukazuje, co dalšího běží na stejném modelu a jak se RTX 6000D porovnává.

Odpovědi

RTX 6000D — Časté dotazy

01

Jaká je šířka paměťové sběrnice RTX 6000D?

RTX 6000D má 1,570 GB/s šířky paměťové šířky na 448bitové paměťové sběrnici. To je jediné nejlepší měřítko toho, jak rychle generuje text, protože vyprodukování každého tokenu znamená přečíst celý model z paměti jednou.

02

Jaký typ paměti používá RTX 6000D?

Používá GDDR7 s taktem 1,75 GHz. Typy HBM se nacházejí na akcelerátorech datových center a mají mnohem vyšší šířku pásma než GDDR používané na desktopových kartách, což je důvod, proč generují tokeny podstatně rychleji při stejné kapacitě.

03

Kdo vyrábí RTX 6000D?

RTX 6000D je produkt od NVIDIA, s čipem vyrobeným společností TSMC, na procesu 5 nm.

04

Kdy byl RTX 6000D vydán?

RTX 6000D byl vydán v březnu 2025.

05

Kolik energie spotřebovává RTX 6000D?

RTX 6000D má jmenovitý příkon desky 600 W a doporučuje se napájecí zdroj systému o výkonu 1 000 W. Generování textu vyžaduje ve špičkách vysoký výkon a mezi požadavky se nečinně pohybuje, takže průměrná spotřeba během pracovního sezení je obvykle výrazně pod jmenovitou hodnotou.

06

Kolik má RTX 6000D cache?

RTX 6000D má 128 KB L1 cache a 128 MB L2 cache. Cache absorbuje část paměťového provozu, který by jinak dosáhl hlavní sběrnice, takže větší L2 poskytuje skromné zvýšení rychlosti generace nad rámec toho, co předpovídá pouze šířka pásma.

07

Jaké jsou TFLOPS RTX 6000D?

RTX 6000D je hodnocena na 97 TFLOPS při poloviční přesnosti a 97 TFLOPS při jediné přesnosti. To jsou peakové aritmetické stropy spíše než dosažitelné rychlosti, a generování textu dosahuje pouze malé části z nich, protože je místo toho omezeno propustností paměti.

08

Kolik tensorových jader má RTX 6000D?

RTX 6000D má 624 tenzorových jader napříč 156 streamovacími multiprocesory. Ty urychlují maticovou aritmetiku, ze které je transformer postaven, což hlavně zrychluje zpracování dlouhého vstupu spíše než produkci odpovědi.

09

Podporuje RTX 6000D CUDA?

Ano. RTX 6000D hlásí CUDA výpočetní schopnost 12.0. Schopnost 7.0 a vyšší má tensorové jádra, která moderní inferenční software používá; pod tímto se vrací k pomalejším kódovým cestám pro kvantizované modely.

10

Jaké autobusové rozhraní používá RTX 6000D?

Používá PCIe 5.0 x16. To určuje, jak rychle se model načítá na kartu, spíše než jak rychle běží po načtení, takže to na začátku trvá několik sekund a během generování nic.

11

Je RTX 6000D dobrá pro spuštění místních AI modelů?

Jeho paměť je dostatečně velká pro modely, ke kterým většina desktopového hardwaru nemůže přistupovat, a jeho šířka pásma je dostatečně vysoká na to, aby generoval text rychleji, než většina lidí čte. Celkem provozuje 609 modelů, které sledujeme. To, zda je to dost, závisí zcela na tom, který model chcete — tabulka výše to přímo odpovídá.

12

Může RTX 6000D spustit model, který se nevejde do její paměti?

Přetížení mimo 84 GB karty je možné a obvykle je to mylná ekonomie: část systémové paměti je dostatečně pomalá, aby dominovala výsledku.

13

Byly by dvě karty RTX 6000D dvakrát rychlejší?

Párování karet RTX 6000D kupuje rezervoár spíše než tempo: 168 GB kombinované paměti, zhruba ve stejné generaci rychlosti jako jedna.

14

Jaké AI modely může RTX 6000D spustit?

609 z 679 otevřených jazykových modelů, které sledujeme, se vejde na RTX 6000D a může být na něm spuštěn lokálně. Tabulka na této stránce uvádí každý z nich, s množstvím paměti, kterou potřebuje, kvantizací, na které běží, a odhadovanou rychlostí generování.

15

Jaký je největší AI model, který může RTX 6000D spustit?

Největší model v našem katalogu, který se vejde na RTX 6000D, je dots.llm1 s 142B parametry, komprimovaný na Q3_K_M. Generuje přibližně 12,6 tokenů za sekundu a potřebuje asi 70,1 GB paměti karty.

16

Kolik tokenů za sekundu produkuje RTX 6000D?

Záleží na modelu. Na RTX 6000D je nejrychlejší model, který sledujeme, Gemma 3 QAT 1B, přibližně 665 tokenů za sekundu, zatímco větší modely běží úměrně pomaleji, protože každý token vyžaduje přečtení celého modelu z paměti jednou. Rychlosti jsou odhady pro jednu konverzaci najednou.

17

Může RTX 6000D spustit 7B model?

Ano. Například RTX 6000D spouští Multi-Token Prediction 7B při Q8_0, používá přibližně 7,9 GB paměti a generuje kolem 99,2 tokenů za sekundu.

18

Může RTX 6000D spustit model 13B?

Ano. Například RTX 6000D spouští DeepSeekMoE-16B na Q8_0, používá přibližně 17,5 GB paměti a generuje přibližně 231 tokenů za sekundu.

19

Může RTX 6000D spustit model 30B?

Ano. Například RTX 6000D spouští ERNIE-4.5-VL-28B-A3B na Q8_0, používající přibližně 29,2 GB paměti a generující přibližně 132 tokenů za sekundu.

20

Může RTX 6000D spustit model 70B?

Ano. Například RTX 6000D spouští Qwen3-Coder-Next na Q6_K, používá přibližně 62,0 GB paměti a generuje kolem 67,1 tokenů za sekundu.

21

Kolik paměti má RTX 6000D?

RTX 6000D má 84 GB GDDR7 paměti. Přibližně desetina je rezervována inference runtime a ovladačem, což ponechává přibližně 75,6 GB k dispozici pro model a jeho konverzaci.

Druhý směr

Když se na to podíváte z druhé strany?

Tato stránka začíná od hardwaru. Pokud již víte, který model chcete, a potřebujete vědět, co je potřeba k jeho spuštění, Začněte raději modelem..

Všechny GPU