Oblicz TPS modelu Quadro T1200 Max-Q na lokalnych modelach AI
Każdy model w naszym katalogu oceniany według tej karty przy długości kontekstu i minimalnej jakości, którą wybierzesz. Prędkość jest szacunkowa dla pojedynczego żądania, obliczona na podstawie przepustowości pamięci tej karty i rozmiaru każdego modelu po skompresowaniu..
Obliczone dla tej karty
679 modele w naszym katalogu razem
Największy model, który obsługuje
DeciLM 6B
5.7B · Q3_K_M · 32.1 tok/s
Najszybszy model
Gemma 3 QAT 1B
67.8 tok/s · 1B
Które modele AI mogą działać na a Quadro T1200 Max-Q?
Ustaw wejścia, odczytaj odpowiedź.
Więcej kontekstu oznacza więcej VRAM dla pamięci rozmowy. Szybkość dotyczy świeżej rozmowy i nie zmienia się przy tym ustawieniu..
Ukrywa modele, które można by zmieścić tylko przez skompresowanie poniżej tego punktu.
97 modele pasują
Obliczanie| Kwantyzacja | Pasuje | ||||||
|---|---|---|---|---|---|---|---|
|
67.8
tok/s
58–81 |
Gemma 3 1B | 1B | Mar 2025 | 1.8 GB | 33k tokeny | Q8_0 | Wygodny |
|
67.8
tok/s
58–81 |
Gemma 3 QAT 1B | 1B | Apr 2025 | 1.8 GB | 33k tokeny | Q8_0 | Wygodny |
|
67.8
tok/s
41–108 · niska pewność |
HGRN 1B (WT 103) ≈ | 1B | Nov 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
67.8
tok/s
41–108 · niska pewność |
LLama 3..2 Typhoon 2 1B ≈ | 1B | Dec 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
67.8
tok/s
41–108 · niska pewność |
OLMo-1B ≈ | 1B | Feb 2024 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
67.8
tok/s
41–108 · niska pewność |
Pythia-1b ≈ | 1B | Apr 2023 | 1.8 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
62.8
tok/s
38–100 · niska pewność |
OpenELM-1.1B ≈ | 1.1B | May 2024 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
61.6
tok/s
37–99 · niska pewność |
DeciCoder-1B ≈ | 1.1B | Aug 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
61.6
tok/s
37–99 · niska pewność |
SantaCoder ≈ | 1.1B | Jan 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
61.6
tok/s
37–99 · niska pewność |
TinyLlama-1.1B (1T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
61.6
tok/s
37–99 · niska pewność |
TinyLlama-1.1B (3T token checkpoint) ≈ | 1.1B | Oct 2023 | 1.9 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
56.5
tok/s
34–90 · niska pewność |
EXAONE 4.0 (1.2B) ≈ | 1.2B | Jul 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
56.5
tok/s
34–90 · niska pewność |
MinerU2.5 ≈ | 1.2B | Sep 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
56.5
tok/s
34–90 · niska pewność |
Pleias 1.0 1.2B ≈ | 1.2B | Dec 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
56.5
tok/s
34–90 · niska pewność |
Pleias-RAG-1B ≈ | 1.2B | Apr 2025 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
55.1
tok/s
47–66 |
Llama 3.2 1B | 1.2B | Sep 2024 | 2.2 GB | 54k tokeny | Q8_0 | Wygodny |
|
54.3
tok/s
33–87 · niska pewność |
MiniCPM-1.2B ≈ | 1.2B | Jun 2024 | 2.0 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
DeepSeek Coder 1.3B ≈ | 1.3B | Jan 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
DeepSeek-VL-1.3B ≈ | 1.3B | Mar 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
DigiRL ≈ | 1.3B | Jun 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
GLA Transformer 1.3B ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
Janus 1.3B ≈ | 1.3B | Oct 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
Kosmos-2.5 ≈ | 1.3B | Aug 2024 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
Otter ≈ | 1.3B | May 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
|
52.1
tok/s
31–83 · niska pewność |
Phi-1 ≈ | 1.3B | Oct 2023 | 2.1 GB | 131k tokeny ? | Q8_0 | Wygodny |
Prędkości są szacunkami dla pojedynczego zapytania — jednej konwersacji na raz — obliczonymi na podstawie przepustowości pamięci, rozmiaru MODELu i kwantyzacji. Rzeczywista przepustowość różni się w zależności od czasu uruchamiania inference i jego wersji. Wartości publikowane przez dostawców sprzętu mierzą wiele jednoczesnych zapytań i są znacznie wyższe..
Na nagranie
Quadro T1200 Max-Q Pełna specyfikacja
Wszystko w bazie danych dla tej karty, uporządkowane według tego, jak bardzo wpływa na uruchamianie modelu językowego, a nie według tego, jak lista specyfikacji by to opisała. MEMORY jest na pierwszym miejscu, ponieważ decyduje o wyniku; reszta to CONTEXT..
VRAM
Dwie specyfikacje decydują, co ta KARTA może uruchomić i jak szybko. Pojemność określa, które modele mieszczą się w GPU VRAM; przepustowość określa, ile tokenów na sekundę generują, gdy już ją uruchomią.
- Rozmiar pamięci
- 4 GB
- Pasmo pamięci
- 160 GB/s
- Typ pamięci
- GDDR6
- Szerokość magistrali pamięci
- 128 bit
- Zegar pamięci
- 1.25 GHz
Czip
Jaki procesor jest na płycie i jak został wyprodukowany. Mniejszy rozmiar procesu zazwyczaj oznacza większą wydajność przy tej samej mocy.
- Procesor graficzny
- TU117
- Architektura
- Turing
- Generacja
- Quadro Turing-M(Tx000)
- Odlewnia
- TSMC
- Rozmiar procesu
- 12 nm
- Transistory
- 4.7 billion
- Gęstość tranzystorów
- 23,500 K/mm²
- Rozmiar die
- 200 mm²
- Pakiet
- BGA-960
- Wydane
- 12 April 2021
Częstotliwości zegara
Jak szybko działa procesor. Warto znacznie mniej tutaj niż w testach wydajności gier: generowanie tekstu jest ograniczone przez przepustowość pamięci, więc wyższa częstotliwość ledwo wpływa na rezultat.
- Zegar bazowy
- 855 MHz
- Zegar zwiększający
- 1.43 GHz
Jednostki przetwarzania
Co zawiera chip. Te elementy napędzają wydajność grafiki i mają znaczenie głównie dla przetwarzania długiego promptu, a nie dla generowania odpowiedzi.
- Jednostki cieniujące
- 1,024
- Jednostki mapowania tekstur
- 64
- Jednostki wyjściowe.Render
- 32
- Procesory strumieniowe
- 16
- cache L1
- 64 KB
- pamięć podręczna L2
- 1 MB
Wydajność teoretyczna
Szczytowe współczynniki arytmetyczne opublikowane dla karty. Są to limity, które żadne rzeczywiste obciążenie nie osiąga, a generowanie tekstu osiąga jedynie małą ich część, ponieważ jest ograniczone przez VRAM, a nie arytmetykę.
- Pół precyzja (FP16)
- 5.8 TFLOPS
- Pojedyncza precyzja (FP32)
- 2.9 TFLOPS
- Podwójna precyzja (FP64)
- 91.2 GFLOPS
- Wskaźnik pikseli
- 46 GPixel/s
- Współczynnik tekstury
- 91 GTexel/s
Płyta
Co jest potrzebne do fizycznej instalacji i zasilania karty — praktyczne ograniczenia, które decydują, czy pasuje do maszyny, którą już posiadasz.
- Pobór mocy (TDP)
- 18 W
- Złącza zasilające
- None
- Interfejs magistrali
- PCIe 3.0 x16
- Szerokość slotu
- IGP
Wsparcie oprogramowania
Jakie interfejsy graficzne i obliczeniowe obsługuje karta. Możliwość obliczeniowa CUDA ma znaczenie dla wnioskowania: poniżej 7.0 nie ma rdzeni tensorowych, a nowoczesne oprogramowanie do wnioskowania wraca do wolniejszych ścieżek kodu.
- zdolność obliczeniowa CUDA
- 7.5
- DirectX
- 12.1
- OpenGL
- 4.6
- Vulkan
- 1.4
- OpenCL
- 3.0
- Model cieniowania
- 6.8
Oferty
Gdzie kupić GPU Quadro T1200 Max-Q
Żaden dostawca obecnie nie wymienia tej karty. Oferty pochodzą od dostawców, którzy publikują je tutaj bezpośrednio. — przejrzyj katalog dostawców zobaczyć, kto sprzedaje co.
Co oznaczają liczby
Pamięć: specyfikacja, która decyduje o wszystkim
VRAM
4 GB
Szerokość pasma
160 GB/s
Największy model
DeciLM 6B
Quadro T1200 Max-Q niesie tylko 4 GB z GDDR6. To ogranicza do mniejszego końca katalogu, a model musi całkowicie zmieścić się w środku, zanim wygeneruje cokolwiek. Rzeczywisty czas działania wynosi około 3.6 GB.
Przepustowość pamięci osiąga 160 GB/s przez magistralę 128 bity. Przepustowość jest prawdziwym ograniczeniem tej karty. Każdy token wymaga odczytania całego modelu z pamięci, więc duży model będzie tutaj wydawał się wolny, nawet gdy się mieści.
To pochodzi z zegara pamięci 1.25 GHz. Poszerzenie magistrali i podniesienie zegara to dwa dźwignie, które ma producent, dlatego karta z nie wybitnymi rdzeniami może nadal generować szybko.
Praktyczny sufit to DeciLM 6B, 5.7B, skompresowane do Q3_K_M i generowanie wokół 32.1 tokeny na sekundę
Układ scalony i jak został zbudowany
Quadro T1200 Max-Q jest zbudowany na procesorze graficznym TU117, używając architektury Turing z NVIDIA, jako część generacji Quadro Turing-M(Tx000).
Chip jest produkowany przez TSMC, na procesie 12 nm, z kostką o wymiarach 200 mm², trzymanie 4.7 billion Transistory. Mniejszy proces zazwyczaj oznacza lepszą wydajność przy tej samej mocy, chociaż w przypadku modeli językowych ma to znacznie mniejsze znaczenie niż subsystem pamięci.
Został wydany w April 2021, szacunkowo 5.3037980990823 lata temu. Wsparcie oprogramowania do wnioskowania zazwyczaj podąża za sprzętem z opóźnieniem roku lub dwóch, więc karta tego wieku zazwyczaj ma dostępne dojrzałe, dobrze zoptymalizowane ścieżki kodu.
Wydajność obliczeniowa i dlaczego ma mniejsze znaczenie, niż się wydaje
FP16
5.8 TFLOPS
FP64
91.2 GFLOPS
Na papierze Quadro T1200 Max-Q osiąga 5.8 TFLOPS przy półprecyzji, i 2.9 TFLOPS przy pojedynczej precyzji. To są wartości szczytowe, żaden rzeczywisty obciążenie ich nie utrzymuje, a generowanie tekstu osiąga tylko małą część z nich — dekodowanie jest ograniczone przez pamięć, a nie przez arytmetykę, co jest powodem, dla którego karta może wyglądać na niezwykle potężną tutaj i nadal produkować tokeny w zwykłym tempie.
Przepustowość podwójnej precyzji osiąga 91.2 GFLOPS. Nie ma to wpływu na uruchamianie modelu językowego — żadna sesja inferencyjna tego nie używa — ale oddziela części datacenter od konsumenckich, ponieważ te drugie celowo to ograniczają.
Zegary działają od podstawy 855 MHz do zwiększenia 1.43 GHz. Warto tu znacznie mniej niż na benchmarkach gier: podnoszenie szybkości zegara poprawia arytmetykę, a arytmetyka nie jest tym, na co czeka generacja.
Pamięć podręczna i jednostki przetwarzające
Quadro T1200 Max-Q ma pamięć podręczną L1 64 KB, wspierany przez pamięć podręczną L2 1 MB. Cache absorbuje część ruchu pamięci, która w przeciwnym razie uderzyłaby w główną magistralę, która jest jednym miejscem na tej stronie, gdzie liczba inna niż przepustowość cicho wpływa na szybkość generacji — duża L2 pozwala większej części zbioru roboczego pozostać blisko rdzeni.
Są 1,024 Jednostki cieniujące, 64 Jednostki mapowania tekstur, i 32 Jednostki wyjściowe.Render. Te napędy obsługują obciążenia graficzne i przyczyniają się do przetwarzania zapytań, ale pozostają bezczynne przez dużą część czasu, gdy model generuje odpowiedź.
Moc, rozmiar i instalacja
Pobór mocy
18 W
Quadro T1200 Max-Q jest oceniane na 18 W. Uruchamianie modelu językowego zajmuje kartę w krótkich momentach zamiast ciągłego — intensywnie korzysta podczas generowania i jest w uśpieniu między zapytaniami — więc utrzymane obciążenie w ciągu roboczego dnia jest zazwyczaj znacznie poniżej nominalnej wartości.
Płyta zajmuje igp. Warto sprawdzić z zasilaczem oraz obudową w maszynie, ponieważ największe karty potrzebują zdecydowanie więcej obu niż typowy komputer stacjonarny oferuje.
Łączy się przez PCIe 3.0 x16. Interfejs reguluje, jak szybko model jest ładowany z dysku do karty, a nie jak szybko działa po załadowaniu, więc węższe połączenie kosztuje kilka sekund na starcie i nic później.
Ekstremy
Największe modele AI, które działają na a Quadro T1200 Max-Q
Największe modele open-weight, które mieszczą się na tej karcie, najnowsze najpierw. Każdy jest pokazany w najlepszej kompresji, jaką karta może pomieścić..
Najszybsze modele AI na a Quadro T1200 Max-Q
Gdzie ta KARTA produkuje tokeny najszybciej. Mniejsze modele dominują tutaj, ponieważ generowanie każdego tokenu oznacza odczytanie całego modelu z pamięci raz..
Krok po kroku
Jak obliczyć liczbę tokenów na sekundę dla a Quadro T1200 Max-Q
Nie musisz niczego obliczać ręcznie — kalkulator gputps.com na tej stronie już obliczył to dla każdego modelu, który ta karta może pomieścić. Odczytanie odpowiedzi zajmuje sześć kroków..
-
01
Znajdź model w tabeli
Tabela zawiera 97 modele, które ta karta może uruchomić. Szukaj według nazwy lub rozmiaru — wpisanie 27b pasuje do liczby parametrów, nawet gdy nazwa tego nie stwierdza.
-
02
Zdecyduj, jak długo trwają twoje rozmowy
Ustaw kontekst na swoją rzeczywistą długość roboczą. Krótkie pytania kosztują prawie nic, ale długi dokument może zająć dużą część 4 GB często jest to to, co pcha duży model na krawędź.
-
03
Wybierz, jak daleko chcesz skompresować
Każdy model jest pokazany w najlepszej kompresji, jaką ta KARTA może pomieścić. Minimalna jakość ukrywa te, które mieszczą się tylko po dalszym ściskaniu, niż byś zaakceptował.
-
04
Przeczytaj prędkość i zasięg
Liczby są obliczane, a nie mierzone. Najszybszy wynik na tej karcie to 67.8 tok/s na Gemma 3 QAT 1B. Ta sama karta i model różnią się od trzydziestu do pięćdziesięciu procent między czasami wykonywania inference.
-
05
Przeczytaj werdykt dopasowania ostatni
Tight dopasowanie działa, ale nie zostawia miejsca na zwiększenie kontekstu później; comfortable ma zapas. Kolumna pamięci pokazuje, czego każdy model potrzebuje w porównaniu do dostępnej 4 GB.
-
06
Sprawdź ten sam model z drugiej strony
Śledzenie modelu na jego stronie pokazuje cały sprzęt, który może go uruchomić, więc możesz zobaczyć, jak wypada w porównaniu do Quadro T1200 Max-Q.
Odpowiedzi
Quadro T1200 Max-Q — częste pytania
Quadro T1200 Max-Q— kto to robi?
To jest produkt NVIDIA, z chipem wyprodukowanym przez TSMC, na procesie 12 nm.
Quadro T1200 Max-Q— kiedy to zostało wydane?
Został wydany w April 2021.
Quadro T1200 Max-Q— ile mocy zużywa?
Moc nominalna karty graficznej wynosi 18 W. Generowanie tekstu bardzo obciąża w krótkich szczytach i idle'uje między żądaniami, więc średnie zużycie podczas sesji roboczej jest zazwyczaj znacznie poniżej określonej wartości.
Quadro T1200 Max-Q— ile pamięci podręcznej ma?
Pamięć podręczna L1 jest 64 KB, i pamięć podręczna L2 jest 1 MB. Cache absorbuje część ruchu pamięci, który w przeciwnym razie dotarłby do głównej magistrali, więc większy L2 daje skromny wzrost prędkości generacji ponad to, co przewiduje sama szerokość pasma.
Quadro T1200 Max-Q— jakie są jego TFLOPS?
Jest oceniane na 5.8 TFLOPS przy połowicznej precyzji i 2.9 TFLOPS przy pojedynczej precyzji. Są to najwyższe sufity arytmetyczne, a nie osiągalne stawki, a generacja tekstu osiąga tylko małą część z nich, ponieważ jest ograniczona przez przepustowość pamięci.
Quadro T1200 Max-Q— czy obsługuje CUDA?
Tak. Raportuje zdolność obliczeniową CUDA. 7.5. Funkcjonalność 7.0 i wyższa ma rdzenie tensorowe, z których korzysta nowoczesne oprogramowanie inferencyjne; poniżej tego korzysta z wolniejszych ścieżek kodu dla modelów kwantyzowanych.
Quadro T1200 Max-Q— Jakiego interfejsu autobusowego używa?
Używa PCIe 3.0 x16. To reguluje, jak szybko model jest ładowany na kartę, a nie jak szybko działa po załadowaniu, więc kosztuje kilka sekund podczas uruchamiania i nic podczas generacji.
Quadro T1200 Max-Q— czy jest dobry do uruchamiania lokalnych modeli AI?
Jego pamięć ogranicza go do mniejszych modeli, chociaż jego przepustowość oznacza, że generowanie będzie wydawać się wolne na większych modelach. W sumie działa 97 modele, które śledzimy. Czy to wystarczy, zależy całkowicie od tego, który model chcesz — tabela powyżej odpowiada na to bezpośrednio.
Quadro T1200 Max-Q— czy może uruchomić model, który nie mieści się w jego VRAM?
Tylko częściowo. Warstwy poza kartą 4 GB zaciąga cały system w dół, a żadne z danych na tej stronie tego nie uwzględnia.
Czy dwa Quadro T1200 Max-Q karty będą dwa razy szybsze?
Nie. Druga karta podwaja pamięć do 8 GB z połączoną pamięcią, w mniej więcej tej samej prędkości generacji co jeden.
Quadro T1200 Max-Q— które modele AI może uruchomić?
97 z 679 modele językowe open-weight, które śledzimy, mieszczą się na tej karcie i mogą być uruchamiane lokalnie. Tabela na tej stronie zawiera każdy z nich, z wymaganą pamięcią, poziomem kwantyzacji oraz szacowaną prędkością generacji.
Quadro T1200 Max-Q— jaki jest największy model AI, który może uruchomić?
Największy model w naszym katalogu, który pasuje, to DeciLM 6B w 5.7B parametry, skompresowane do Q3_K_M. Generuje mniej więcej 32.1 tokenów na sekundę i potrzebuje około 3.5 GB pamięci karty.
Quadro T1200 Max-Q— Ile tokenów na sekundę produkuje?
To zależy od modelu. Najszybszy model, który śledzimy tutaj, to Gemma 3 QAT 1B około 67.8 tokenów na sekundę, podczas gdy większe modele działają proporcjonalnie wolniej, ponieważ każdy token wymaga odczytania całego modelu z pamięci za każdym razem. Prędkości są szacunkami dla jednej rozmowy na raz.
Quadro T1200 Max-Q— Ile ma pamięci?
Ta karta ma 4 GB z GDDR6. Około jedna dziesiąta jest zarezerwowana przez czas wykonywania wnioskowania i sterownik, pozostawiając mniej więcej 3.6 GB dostępny dla modelu i jego rozmowy
Quadro T1200 Max-Q— jaka jest jej przepustowość VRAM?
Przepustowość pamięci osiąga 160 GB/s przez magistralę 128 bity. To jest jedyny najlepszy wskaźnik tego, jak szybko generuje tekst, ponieważ produkcja każdego tokena oznacza odczytanie całego modelu z pamięci jednocześnie.
Quadro T1200 Max-Q— Jakiego typu pamięci używa?
Używa GDDR6 prędkość zegara na 1.25 GHz. Typy HBM znajdują się na akceleratorach w centrum danych i mają znacznie większą przepustowość niż GDDR używane na kartach stacjonarnych, dlatego generują tokeny znacznie szybciej przy tej samej pojemności.
Druga strona
Patrząc na to z drugiej strony?
Ta strona zaczyna się od sprzętu. Jeśli już wiesz, jaki model chcesz i potrzebujesz wiedzieć, co jest potrzebne do jego uruchomienia, Zacznij od modelu zamiast.