Spočítejte TPS modelu RTX 6000D o místních AI modelech
Každý model v našem katalogu je hodnocen podle této karty s ohledem na délku kontextu a požadovanou minimální kvalitu, kterou si zvolíte. Rychlost je odhad pro jedno požadavek, vypočtený na základě šířky pásma paměti této karty a velikosti každého modelu po kompresi..
Vypočteno pro tuto kartu
679 modely v našem katalogu dohromady
Největší model, který dokáže zvládnout
dots.llm1
142B · Q3_K_M · 12.6 tok/s
Nejrychlejší model
Gemma 3 QAT 1B
665 tok/s · 1B
Které AI modely lze spustit na RTX 6000D?
Nastavte vstupy, přečtěte odpověď
Více kontextu znamená více paměti pro mezipaměť konverzace. Rychlost je určena pro novou konverzaci a s tímto nastavením se nemění.
skrývá modely, které by se vešly pouze při kompresi pod tímto bodem.
609 modely odpovídají
Výpočet| Kvantizace | Vhodné | ||||||
|---|---|---|---|---|---|---|---|
|
665
tok/s
565–798 |
Gemma 3 1B | 1B | Mar 2025 | 1.8 GB | 33k tokeny | Q8_0 | pohodlné |
|
665
tok/s
565–798 |
Gemma 3 QAT 1B | 1B | Apr 2025 | 1.8 GB | 33k tokeny | Q8_0 | pohodlné |
|
665
tok/s
399–1,064 · nízká důvěryhodnost |
HGRN 1B (WT 103) ≈ | 1B | Nov 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
665
tok/s
399–1,064 · nízká důvěryhodnost |
LLama 3..2 Typhoon 2 1B ≈ | 1B | Dec 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
665
tok/s
399–1,064 · nízká důvěryhodnost |
OLMo-1B ≈ | 1B | Feb 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
665
tok/s
399–1,064 · nízká důvěryhodnost |
Pythia-1b ≈ | 1B | Apr 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
616
tok/s
369–985 · nízká důvěryhodnost |
OpenELM-1.1B ≈ | 1.1B | May 2024 | 1.9 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
604
tok/s
363–967 · nízká důvěryhodnost |
DeciCoder-1B ≈ | 1.1B | Aug 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
604
tok/s
363–967 · nízká důvěryhodnost |
SantaCoder ≈ | 1.1B | Jan 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
604
tok/s
363–967 · nízká důvěryhodnost |
TinyLlama-1.1B (1T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
604
tok/s
363–967 · nízká důvěryhodnost |
TinyLlama-1.1B (3T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
554
tok/s
332–887 · nízká důvěryhodnost |
EXAONE 4.0 (1.2B) ≈ | 1.2B | Jul 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
554
tok/s
332–887 · nízká důvěryhodnost |
MinerU2.5 ≈ | 1.2B | Sep 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
554
tok/s
332–887 · nízká důvěryhodnost |
Pleias 1.0 1.2B ≈ | 1.2B | Dec 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
554
tok/s
332–887 · nízká důvěryhodnost |
Pleias-RAG-1B ≈ | 1.2B | Apr 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
541
tok/s
460–649 |
Llama 3.2 1B | 1.2B | Sep 2024 | 2.2 GB | 131k tokeny | Q8_0 | pohodlné |
|
533
tok/s
320–853 · nízká důvěryhodnost |
MiniCPM-1.2B ≈ | 1.2B | Jun 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
DeepSeek Coder 1.3B ≈ | 1.3B | Jan 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
DeepSeek-VL-1.3B ≈ | 1.3B | Mar 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
DigiRL ≈ | 1.3B | Jun 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
GLA Transformer 1.3B ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
Janus 1.3B ≈ | 1.3B | Oct 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
Kosmos-2.5 ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
Otter ≈ | 1.3B | May 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
|
511
tok/s
307–818 · nízká důvěryhodnost |
Phi-1 ≈ | 1.3B | Oct 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | pohodlné |
Rychlosti jsou odhady pro jedinou žádost — jednu konverzaci najednou — vypočtené z paměťové šířky pásma, velikosti modelu a kvantizace. Skutečný průtok se liší v závislosti na době inference a její verzi. Čísla publikovaná výrobci hardware měří mnoho současných žádostí a jsou mnohem vyšší.
Záznam.
RTX 6000D Plná specifikace
Všechno zaznamenané na této desce, seřazené podle toho, jak moc ovlivňuje běh jazykového modelu, nikoli podle toho, jak by to uvedla specifikace. Paměť přichází jako první, protože rozhoduje o výsledku; zbytek je kontext..
Paměť
Dva specifikace, které rozhodují, co tato karta může spustit a jak rychle. Kapacita určuje, které modely se vejdou; šířka pásma určuje, kolik tokenů za sekundu vyprodukují, jakmile to udělají.
- Velikost paměti
- 84 GB
- Šířka pásma paměti
- 1,570 GB/s
- Typ paměti
- GDDR7
- Šířka paměťové sběrnice
- 448 bit
- Paměťový takt
- 1.75 GHz
Čip
Který procesor je na desce a jak byl vyroben. Menší velikost technologického procesu obvykle znamená vyšší výkon při stejné spotřebě energie.
- Grafický procesor
- GB202
- Architektura
- Blackwell 2.0
- Generace
- Blackwell PRO W(x000)
- Foundry
- TSMC
- Velikost procesu
- 5 nm
- Tranzistory
- 92.2 billion
- Hustota tranzistorů
- 122,900 K/mm²
- Velikost模型
- 750 mm²
- Vydáno
- 18 March 2025
Frekvence hodin
Jak rychle procesor běží. Tady má mnohem menší hodnotu než na herním benchmarku: generování textu je omezeno šířkou pásma paměti, takže vyšší takt téměř neposune výsledek.
- Základní frekvence
- 1.59 GHz
- Zvýšení taktovací frekvence
- 2.43 GHz
Zpracovací jednotky
Co čip obsahuje. Tyto ovlivňují výkon grafiky a mají hlavní význam pro zpracování dlouhého příkazu spíše než pro produkci odpovědi.
- Stínovací jednotky
- 19,968
- Jednotky texturového mapování
- 624
- Jednotky výstupu renderování
- 192
- Streaming multiprocessory
- 156
- Tensor jádra
- 624
- Jádra ray tracing
- 156
- L1 cache
- 128 KB
- L2 vyrovnávací paměť
- 128 MB
Teoretický výkon
Špičkové aritmetické rychlosti publikované pro desku. To jsou stropy, které žádné skutečné zatížení nedosahuje, a generování textu dosahuje pouze malé části z nich, protože je omezeno pamětí spíše než aritmetikou.
- Poloviční přesnost (FP16)
- 97 TFLOPS
- Jednoduchá přesnost (FP32)
- 97 TFLOPS
- Dvojitá přesnost (FP64)
- 1.5 TFLOPS
- Frekvence pixelů
- 467 GPixel/s
- Míra textury
- 1,516 GTexel/s
Deska
Co je potřeba k fyzické instalaci a napájení karty — praktické omezení, která rozhodují, zda se vejde do stroje, který již vlastníte.
- Příkon (TDP)
- 600 W
- Navrhovaný zdroj napájení
- 1,000 W
- Konektory napájení
- 1x 16-pin
- Rozhraní sběrnice
- PCIe 5.0 x16
- Šířka slotu
- Dual-slot
- Rozměry
- 304 mm × 40 mm
- Zobrazit výstupy
- 4x DisplayPort 2.1b
Podpora softwaru
Jaké grafické a výpočetní rozhraní karta podporuje. CUDA výpočetní schopnost je ta, která se týká inferencí: pod 7.0 nejsou žádné tensorové jádra a moderní inferenční software se vrací k pomalejším kódovým cestám.
- CUDA výpočetní schopnost
- 12.0
- DirectX
- 12.2
- OpenGL
- 4.6
- Vulkan
- 1.4
- OpenCL
- 3.0
- Shader model
- 6.8
Záznamy
Kde koupit a RTX 6000D
Žádný prodejce momentálně tento karty nenabízí. Nabídky pocházejí od prodejců, kteří je zde přímo zveřejňují. — procházet adresář dodavatelů vidět, kdo prodává co.
Co čísla znamenají
Kapacita a šířka pásma
Paměť
84 GB
Šířka pásma
1,570 GB/s
Největší model
dots.llm1
S 84 GB GDDR7 je RTX 6000D ve třídě hardwaru, která zvládá největší modely s otevřenou váhou bez jejich rozdělení mezi stroje. Přibližně 75,6 GB z toho je přístupných inference runtime poté, co ovladač vezme svou část.
Šířka pásma je 1,570 GB/s přes 448-bitovou sběrnici. Generování tokenu znamená přečtení každé váhy jednou, takže toto číslo určuje tempo více než jakékoli jiné číslo zde, a na této úrovni text přichází rychleji, než většina lidí čte.
Číslo je paměťové hodiny — 1,75 GHz zde — násobené šířkou sběrnice. Je to důvod, proč počty jader tak špatně predikují rychlost generace.
V praxi tato kombinace dosahuje maximální hodnoty na dots.llm1 — 142B, komprimována na Q3_K_M, generující přibližně 12,6 tokenů za sekundu.
Čip a jak byl postaven
RTX 6000D je postaven na grafickém procesoru GB202, využívající architekturu Blackwell 2.0 od NVIDIA, jako součást generace Blackwell PRO W(x000).
Čip vyrábí TSMC, na procesu 5 nm, s čipem o rozměrech 750 mm², obsahujícím 92,2 miliardy tranzistorů. Menší proces obecně znamená vyšší výkon při stejné spotřebě, avšak pro jazykové modely to má mnohem menší význam než paměťový subsystém.
Bylo to vydáno v březnu 2025, přibližně před 1 rokem. Podpora inferenčního softwaru obvykle následuje hardware o rok nebo dva, takže karta tohoto stáří má obvykle k dispozici vyzrálé, dobře optimalizované cesty kódu.
Provozní propustnost a proč je méně důležitá, než to vypadá
FP16
97 TFLOPS
FP64
1.5 TFLOPS
Tensor jádra
624
Na papíře RTX 6000D dosahuje 97 TFLOPS při poloviční přesnosti a 97 TFLOPS při jednoduché přesnosti. Toto jsou vrcholné hodnoty, které žádné skutečné zatížení neudržuje, a generování textu dosahuje pouze malé části z nich — dekódování je omezeno pamětí spíše než aritmetikou, což je důvod, proč může karta zde vypadat nesmírně výkonně a přesto produkovat tokeny v obyčejné rychlosti.
Dvojitá přesnost propustnosti je 1,5 TFLOPS. Nemá to žádný vliv na běh jazykového modelu — žádný inference runtime to nepoužívá — ale odděluje části datového centra od spotřebitelských, protože ty druhé to úmyslně omezují.
Karta obsahuje 624 tensorových jader napříč 156 streamovacími multiprocesory. Tyto akcelerují maticovou aritmetiku, která je srdcem transformátoru, a právě díky nim je zpracování promptu — čtení dlouhého dokumentu před odpovědí — dramaticky rychlejší, než by jinak bylo.
Hodiny běží od 1,59 GHz při základním taktu až do 2,43 GHz při zvýšeném taktu. V tuto chvíli mají výrazně nižší hodnotu než na herních benchmarkích: zvyšování taktu zrychluje aritmetiku, a aritmetika není to, na co generace čeká.
Cache a výpočetní jednotky
RTX 6000D má 128 KB L1 cache, podpořenou 128 MB L2. Cache pohlcuje část paměťového provozu, který by jinak zasáhl hlavní sběrnici, což je jediné místo na této stránce, kde jiné číslo než šířka pásma tiše ovlivňuje rychlost generování — velké L2 umožňuje udržet více pracovního souboru blízko jader.
Je zde 19,968 stínovacích jednotek, 624 jednotek pro mapování textur a 192 jednotek pro výstup vykreslování. Tyto jedou grafické úlohy a přispívají k rychlému zpracování, ale většinu času, který model tráví generováním odpovědi, zůstávají nevyužité.
Výkon, velikost a instalace
Příkon
600 W
RTX 6000D má výkon 600 W, přičemž pro celý systém se doporučuje napájecí zdroj o výkonu 1 000 W. Spouštění jazykového modelu zaměstnává kartu v přerušovaných intervalech spíše než nepřetržitě — čerpá energii při generování a nečinní mezi požadavky — takže dlouhodobé čerpání během pracovního dne je obvykle výrazně pod uvedeným číslem.
Deska zaujímá dvojslot, měří 304 mm na délku a potřebuje 1x 16-pin. Stojí za to zkontrolovat proti skříni a napájecímu zdroji, které již jsou v zařízení, protože největší karty potřebují výrazně více obojího než typický desktop nabízí.
Spojuje se přes PCIe 5.0 x16. Rozhraní určuje, jak rychle se model načte z disku do karty, nikoli jak rychle běží poté, co je tam, takže užší spojení stojí v úvodu několik sekund a poté nic.
Extrémy
Největší AI modely, které běží na RTX 6000D
Největší modely s otevřenou váhou, které se vejdou na tuto kartu, nejnovější první. Každý je zobrazen v nejlepší kompresi, kterou karta může držet..
Nejrychlejší AI modely na RTX 6000D
Kde tato karta produkuje tokeny nejrychleji. Menší modely zde dominují, protože generování každého tokenu znamená načíst celý model z paměti jednou..
krok za krokem
Jak spočítat počet tokenů za sekundu u a RTX 6000D
Nemusíte nic počítat ručně — kalkulačka na gputps.com na této stránce již vypočítala pro každý model, který tato karta může držet. Získání odpovědi vyžaduje šest kroků.
-
01
Hledejte model, který chcete
Tabulka uvádí 609 modelů, které může RTX 6000D spustit. Hledejte podle názvu nebo podle velikosti — zadání 27b odpovídá na počet parametrů, i když název to nikdy neuvádí.
-
02
Přizpůsobte kontext svému pracovnímu nasazení
Delší konverzace stojí paměť navíc k váhám. S 84 GB k dispozici je to často rozdíl mezi modelem, který se vejde, a tím, který se nevejde.
-
03
Přiřaďte srovnání k jedné kvalitativní úrovni
Ve výchozím nastavení tabulka vybírá nejméně komprimovanou kopii, která se vejde. Nastavení podlahy odstraňuje modely, které splňují kritéria pouze díky silné kompresi.
-
04
Přečtěte si rychlost a dosah
Každá rychlost je odhad pro jedinou konverzaci, s rozsahem pod ní — 665 tok/s na Gemma 3 QAT 1B na vrcholu zde. Ta samá karta a model se liší o třicet až padesát procent mezi běhy inference.
-
05
Zkontrolujte prostor před tím, než se rozhodnete
Sloupec vhodnosti odděluje modely, které se právě vejdou, od těch, které mají ještě prostor navíc - stojí za to ověřit s kartou 84 GB, než se rozhodnete pro jeden.
-
06
Zkontrolujte stejný model z druhé strany
Každá stránka modelu opakuje tento výpočet pro celý katalog. Stojí za to se podívat před rozhodnutím: ukazuje, co dalšího běží na stejném modelu a jak se RTX 6000D porovnává.
Odpovědi
RTX 6000D — Časté dotazy
Jaká je šířka paměťové sběrnice RTX 6000D?
RTX 6000D má 1,570 GB/s šířky paměťové šířky na 448bitové paměťové sběrnici. To je jediné nejlepší měřítko toho, jak rychle generuje text, protože vyprodukování každého tokenu znamená přečíst celý model z paměti jednou.
Jaký typ paměti používá RTX 6000D?
Používá GDDR7 s taktem 1,75 GHz. Typy HBM se nacházejí na akcelerátorech datových center a mají mnohem vyšší šířku pásma než GDDR používané na desktopových kartách, což je důvod, proč generují tokeny podstatně rychleji při stejné kapacitě.
Kdo vyrábí RTX 6000D?
RTX 6000D je produkt od NVIDIA, s čipem vyrobeným společností TSMC, na procesu 5 nm.
Kdy byl RTX 6000D vydán?
RTX 6000D byl vydán v březnu 2025.
Kolik energie spotřebovává RTX 6000D?
RTX 6000D má jmenovitý příkon desky 600 W a doporučuje se napájecí zdroj systému o výkonu 1 000 W. Generování textu vyžaduje ve špičkách vysoký výkon a mezi požadavky se nečinně pohybuje, takže průměrná spotřeba během pracovního sezení je obvykle výrazně pod jmenovitou hodnotou.
Kolik má RTX 6000D cache?
RTX 6000D má 128 KB L1 cache a 128 MB L2 cache. Cache absorbuje část paměťového provozu, který by jinak dosáhl hlavní sběrnice, takže větší L2 poskytuje skromné zvýšení rychlosti generace nad rámec toho, co předpovídá pouze šířka pásma.
Jaké jsou TFLOPS RTX 6000D?
RTX 6000D je hodnocena na 97 TFLOPS při poloviční přesnosti a 97 TFLOPS při jediné přesnosti. To jsou peakové aritmetické stropy spíše než dosažitelné rychlosti, a generování textu dosahuje pouze malé části z nich, protože je místo toho omezeno propustností paměti.
Kolik tensorových jader má RTX 6000D?
RTX 6000D má 624 tenzorových jader napříč 156 streamovacími multiprocesory. Ty urychlují maticovou aritmetiku, ze které je transformer postaven, což hlavně zrychluje zpracování dlouhého vstupu spíše než produkci odpovědi.
Podporuje RTX 6000D CUDA?
Ano. RTX 6000D hlásí CUDA výpočetní schopnost 12.0. Schopnost 7.0 a vyšší má tensorové jádra, která moderní inferenční software používá; pod tímto se vrací k pomalejším kódovým cestám pro kvantizované modely.
Jaké autobusové rozhraní používá RTX 6000D?
Používá PCIe 5.0 x16. To určuje, jak rychle se model načítá na kartu, spíše než jak rychle běží po načtení, takže to na začátku trvá několik sekund a během generování nic.
Je RTX 6000D dobrá pro spuštění místních AI modelů?
Jeho paměť je dostatečně velká pro modely, ke kterým většina desktopového hardwaru nemůže přistupovat, a jeho šířka pásma je dostatečně vysoká na to, aby generoval text rychleji, než většina lidí čte. Celkem provozuje 609 modelů, které sledujeme. To, zda je to dost, závisí zcela na tom, který model chcete — tabulka výše to přímo odpovídá.
Může RTX 6000D spustit model, který se nevejde do její paměti?
Přetížení mimo 84 GB karty je možné a obvykle je to mylná ekonomie: část systémové paměti je dostatečně pomalá, aby dominovala výsledku.
Byly by dvě karty RTX 6000D dvakrát rychlejší?
Párování karet RTX 6000D kupuje rezervoár spíše než tempo: 168 GB kombinované paměti, zhruba ve stejné generaci rychlosti jako jedna.
Jaké AI modely může RTX 6000D spustit?
609 z 679 otevřených jazykových modelů, které sledujeme, se vejde na RTX 6000D a může být na něm spuštěn lokálně. Tabulka na této stránce uvádí každý z nich, s množstvím paměti, kterou potřebuje, kvantizací, na které běží, a odhadovanou rychlostí generování.
Jaký je největší AI model, který může RTX 6000D spustit?
Největší model v našem katalogu, který se vejde na RTX 6000D, je dots.llm1 s 142B parametry, komprimovaný na Q3_K_M. Generuje přibližně 12,6 tokenů za sekundu a potřebuje asi 70,1 GB paměti karty.
Kolik tokenů za sekundu produkuje RTX 6000D?
Záleží na modelu. Na RTX 6000D je nejrychlejší model, který sledujeme, Gemma 3 QAT 1B, přibližně 665 tokenů za sekundu, zatímco větší modely běží úměrně pomaleji, protože každý token vyžaduje přečtení celého modelu z paměti jednou. Rychlosti jsou odhady pro jednu konverzaci najednou.
Může RTX 6000D spustit 7B model?
Ano. Například RTX 6000D spouští Multi-Token Prediction 7B při Q8_0, používá přibližně 7,9 GB paměti a generuje kolem 99,2 tokenů za sekundu.
Může RTX 6000D spustit model 13B?
Ano. Například RTX 6000D spouští DeepSeekMoE-16B na Q8_0, používá přibližně 17,5 GB paměti a generuje přibližně 231 tokenů za sekundu.
Může RTX 6000D spustit model 30B?
Ano. Například RTX 6000D spouští ERNIE-4.5-VL-28B-A3B na Q8_0, používající přibližně 29,2 GB paměti a generující přibližně 132 tokenů za sekundu.
Může RTX 6000D spustit model 70B?
Ano. Například RTX 6000D spouští Qwen3-Coder-Next na Q6_K, používá přibližně 62,0 GB paměti a generuje kolem 67,1 tokenů za sekundu.
Kolik paměti má RTX 6000D?
RTX 6000D má 84 GB GDDR7 paměti. Přibližně desetina je rezervována inference runtime a ovladačem, což ponechává přibližně 75,6 GB k dispozici pro model a jeho konverzaci.
Druhý směr
Když se na to podíváte z druhé strany?
Tato stránka začíná od hardwaru. Pokud již víte, který model chcete, a potřebujete vědět, co je potřeba k jeho spuštění, Začněte raději modelem..