Számítsa ki a TPS-t a Tesla M2075 helyi AI modellek

NVIDIA 6 GB GDDR5 150 GB/s July 2011

Minden modell a katalógusunkban, amelyet ezzel a kártyával értékeltünk a kiválasztott kontextus hosszán és minimális minőségen. A sebesség egyetlen kérés becslése, amelyet ezen kártya memória sávszélessége és minden modell mérete alapján számoltak ki, miután tömörítették..

Kiszámítva ehhez a kártyához

280 modellek, amelyeket futtathat

721 modellek az adatbázisunkban összesen

A legnagyobb modell, amit tartalmaz.

Qwen-VL

9.6B · Q3_K_M · 15.2 tok/s

Leggyorsabb modell

Gemma 3 QAT 1B

54.1 tok/s · 1B

Mely AI modellek futhatnak egy Tesla M2075?

Állítsa be a bemeneteket, olvassa el a választ

Több kontextus több MEMÓRIÁT jelent a beszélgetés gyorsítótárához. A sebesség egy friss beszélgetéshez való, és nem változik ezzel a beállítással..

Elrejti azokat a modelleket, amelyek csak ezen a ponton alá tömörítve férnének el..

280 modellek megfelelnek

Számítás
Kvantisálás Illeszkedik
54.1 tok/s

19–108 · alacsony bizalom

Gemma 3 1B 1B Mar 2025 1.8 GB 33k tokenek Q8_0 Kényelmes
54.1 tok/s

19–108 · alacsony bizalom

Gemma 3 QAT 1B 1B Apr 2025 1.8 GB 33k tokenek Q8_0 Kényelmes
54.1 tok/s

19–108 · alacsony bizalom

HGRN 1B (WT 103) 1B Nov 2023 1.8 GB 131k tokenek ? Q8_0 Kényelmes
54.1 tok/s

19–108 · alacsony bizalom

LLama 3..2 Typhoon 2 1B 1B Dec 2024 1.8 GB 131k tokenek ? Q8_0 Kényelmes
54.1 tok/s

19–108 · alacsony bizalom

OLMo-1B 1B Feb 2024 1.8 GB 131k tokenek ? Q8_0 Kényelmes
54.1 tok/s

19–108 · alacsony bizalom

Pythia-1b 1B Apr 2023 1.8 GB 131k tokenek ? Q8_0 Kényelmes
50.1 tok/s

18–100 · alacsony bizalom

OpenELM-1.1B 1.1B May 2024 1.9 GB 131k tokenek ? Q8_0 Kényelmes
49.2 tok/s

17–98 · alacsony bizalom

DeciCoder-1B 1.1B Aug 2023 1.9 GB 131k tokenek ? Q8_0 Kényelmes
49.2 tok/s

17–98 · alacsony bizalom

SantaCoder 1.1B Jan 2023 1.9 GB 131k tokenek ? Q8_0 Kényelmes
49.2 tok/s

17–98 · alacsony bizalom

TinyLlama-1.1B (1T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokenek ? Q8_0 Kényelmes
49.2 tok/s

17–98 · alacsony bizalom

TinyLlama-1.1B (3T token checkpoint) 1.1B Oct 2023 1.9 GB 131k tokenek ? Q8_0 Kényelmes
45.1 tok/s

16–90 · alacsony bizalom

EXAONE 4.0 (1.2B) 1.2B Jul 2025 2.0 GB 131k tokenek ? Q8_0 Kényelmes
45.1 tok/s

16–90 · alacsony bizalom

LFM2-1.2B 1.2B Jul 2025 2.0 GB 131k tokenek ? Q8_0 Kényelmes
45.1 tok/s

16–90 · alacsony bizalom

MinerU2.5 1.2B Sep 2025 2.0 GB 131k tokenek ? Q8_0 Kényelmes
45.1 tok/s

16–90 · alacsony bizalom

Pleias 1.0 1.2B 1.2B Dec 2024 2.0 GB 131k tokenek ? Q8_0 Kényelmes
45.1 tok/s

16–90 · alacsony bizalom

Pleias-RAG-1B 1.2B Apr 2025 2.0 GB 131k tokenek ? Q8_0 Kényelmes
44.0 tok/s

15–88 · alacsony bizalom

Llama 3.2 1B 1.2B Sep 2024 2.2 GB 113k tokenek Q8_0 Kényelmes
43.4 tok/s

15–87 · alacsony bizalom

MiniCPM-1.2B 1.2B Jun 2024 2.0 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

DeepSeek Coder 1.3B 1.3B Jan 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

DeepSeek-VL-1.3B 1.3B Mar 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

DigiRL 1.3B Jun 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

GLA Transformer 1.3B 1.3B Aug 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

Janus 1.3B 1.3B Oct 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

Kosmos-2.5 1.3B Aug 2024 2.1 GB 131k tokenek ? Q8_0 Kényelmes
41.6 tok/s

15–83 · alacsony bizalom

Otter 1.3B May 2023 2.1 GB 131k tokenek ? Q8_0 Kényelmes

A sebességek egyetlen kérésre vonatkozó becslések — egy beszélgetés egyszerre — a MEMORY BANDWIDTH, a MODEL SIZE és a QUANTISATION alapján számítva. A valódi áteresztő képesség változik az INFERENCE RUNTIME-jal és annak verziójával. A HARDWARE VENDORS által közzétett számadatok sok egyidejű kérést mérnek és sokkal magasabbak..

Nyilvántartásban

Tesla M2075 Teljes specifikáció

Minden az erre a lapra vonatkozóan, rendezve aszerint, mennyire befolyásolja egy nyelvi modell futtatását, nem pedig aszerint, ahogyan egy specifikációs táblázat felsorolná. A MEMORY az első, mert ez határozza meg az eredményt; a többi a CONTEXT..

VRAM

A két specifikáció, amely meghatározza, hogy ez a KÁRTYA mit tud futtatni és milyen gyorsan. A kapacitás határozza meg, hogy mely modellek férnek el; a sávszélesség határozza meg, hogy másodpercenként hány tokent termelnek, miután elindultak.

Memóriaméret
6 GB
Memória sávszélesség
150 GB/s
Memória típus
GDDR5
Memória busz szélessége
384 bit
Memória óra
783 MHz

A chip

Milyen processzor található az alaplapon és hogyan gyártották? A kisebb gyártási méret általában nagyobb teljesítményt jelent ugyanazon energiafogyasztás mellett.

Grafikus feldolgozó
GF110
Architektúra
Fermi 2.0
Generáció
Tesla Fermi(x20xx)
Öntödé
TSMC
Feldolgozási méret
40 nm
Tranzisztorok
3 billion
Tranzisztor sűrűség
5,800 K/mm²
Die méret
520 mm²
Csomag
BGA-1981
Kiadott
25 July 2011

Óra sebességek

Milyen gyorsan fut a processzor. Itt sokkal kevesebbet ér, mint egy játékteszt során: a szöveggenerálás a memória sávszélessége által korlátozott, így egy magasabb órajel alig mozdítja el az eredményt.

Alap óra
574 MHz
Turbóóra
574 MHz

Feldolgozó egységek

Mit tartalmaz a chip. Ezek hajtják a grafikai teljesítményt, és elsősorban a hosszú prompt feldolgozása szempontjából számítanak, nem pedig a válasz előállítása miatt.

árnyékoló egységek
448
Textúrázási egységek
56
Kép renderelő egységek
48
Streaming multiprocesszorok
14
L1 gyorsítótár
64 KB
L2 gyorsítótár
0.75 MB

Elméleti teljesítmény

A lapra közzétett csúcsaritmetikai sebességek. Ezek olyan plafonok, amelyeket egy valódi munkaterhelés sem ér el, és a szöveg generálása csak ezek kis részét éri el, mert a memória korlátozza, nem az aritmetika.

Egyszeres pontosság (FP32)
1 TFLOPS
Kettős pontosság (FP64)
513.9 GFLOPS
Pixelek aránya
16 GPixel/s
Textúra sebesség
32 GTexel/s

A lap

Mi szükséges a kártya fizikális telepítéséhez és működtetéséhez - azok a gyakorlati korlátok, amelyek eldöntik, hogy illeszkedik-e a már meglévő géphez.

Teljesítményfelvétel (TDP)
225 W
Javasolt tápegység
550 W
Áramellátó csatlakozók
1x 6-pin + 1x 8-pin
Busz interfész
PCIe 2.0 x16
Slot szélesség
Dual-slot
Dimenziók
248 mm

Szoftver-támogatás

Milyen grafikai és számítási interfészeket támogat a kártya. A CUDA számítási képesség az, amely hatással van a következtetésre: 7.0 alatt nincsenek tensor magok, és a modern következtető szoftver a lassabb kódpathokra tér vissza.

CUDA számítási képesség
2.0
DirectX
11.0
OpenGL
4.6
OpenCL
1.1
Shader modell
5.1

Lista

Hol lehet venni egy Tesla M2075

Jelenleg egyetlen forgalmazó sem listázza ezt a kártyát. A listák olyan forgalmazóktól származnak, akik közvetlenül itt publikálják őket. — böngészés a forgalmazói könyvtárban látni, hogy ki mit árul.

Mit jelentenek a számok

Mit jelent a memóriaalrendszer az AI számára

VRAM

6 GB

Sávszélesség

150 GB/s

Legnagyobb modell

Qwen-VL

Tesla M2075 csak hordoz 6 GB -nak GDDR5. Ez korlátozza a katalógus kisebb végére, és egy modellnek teljesen bele kell férnie, mielőtt bármilyen kimenetet generál. Egy futás valójában körülbelül 5.4 GB.

A memóriával rendelkező sávszélesség eléri 150 GB/s egy buszon keresztül a 384 bit. A Sávszélesség ennek a kártyának a valódi korlátozása. Minden token megköveteli az egész modell kiolvasását a memóriából, így egy nagy modell lassúnak tűnik itt, még akkor is, ha belefér.

A szám a busz szélessége és a memória óra szorzataként van. 783 MHz. Mindkét fél fontos, és egyik sem látható egy játéktesztben.

Összeállítva a legnagyobb modell, ami belefér, az Qwen-VL, 9.6B, tömörítve Q3_K_M és generálás körül 15.2 tokenek másodpercenként

A chip és hogy hogyan építették.

Tesla M2075 a grafikus feldolgozón van építve GF110, az architektúra használatával Fermi 2.0 ból NVIDIA, a generáció részeként Tesla Fermi(x20xx).

A chip-et a következő gyártó készíti TSMC, egy folyamatban 40 , egy kockával, amely méri 520 mm², tartás 3 billion Tranzisztorok. Egy kisebb folyamat általában nagyobb teljesítményt jelent ugyanannyi energia mellett, bár a nyelvi modellek esetében ez sokkal kevésbé számít, mint a memória alrendszer.

Megjelent a July 2011, nagyjából 15.142597518016 évekkel ezelőtt. A következtetési szoftver támogatás általában egy-két évvel követi a hardvert, így egy ilyen korú KÁRTYA általában érett, jól optimalizált kódútvonalakkal rendelkezik.

Számítási áteresztőképesség, és hogy miért számít kevesebbet, mint amilyennek látszik

FP64

513.9 GFLOPS

A dupla pontosságú áteresztőképesség eléri 513.9 GFLOPS. Nincs hatással a nyelvi modell futtatására — a következtetési futási idő nem használja — de elválasztja az adatközponti részeket a fogyasztóiaktól, mivel az utóbbi szándékosan korlátozza azt.

Az órajelek egy alapból futnak 574 MHz egy gyorsításra 574 MHz. Itt sokkal kevesebbet ér, mint egy játékbenchmarkon: az órajelek emelése felgyorsítja az aritmetikát, és az aritmetika nem az, amire a generáció vár.

Cache és feldolgozó egységek

Tesla M2075 L1 gyorsítótárral rendelkezik 64 Kb, L2 gyorsítótár támogatásával 0.75 MB. A cache egy részesedést felszív a memóriaforgalomból, ami egyébként a fő buszt érné el, ami az egyetlen hely ezen az oldalon, ahol a sávszélességen kívül más szám is csendben befolyásolja a generálási sebességet — egy nagy L2 lehetővé teszi, hogy a munkakészlet több része közel maradjon a magokhoz.

Vannak 448 árnyékoló egységek, 56 Textúrázási egységek, és 48 Render kimeneti egységek. Ezek grafikai munkaterheket kezelnek és hozzájárulnak a prompt feldolgozáshoz, de a modell válasz generálásával töltött idő nagy részében tétlenül állnak.

Teljesítmény, méret és telepítés

Teljesítményfogyasztás

225 W

Tesla M2075 rated at 225 W, és a javasolt rendszer tápegység 550 W. Egy nyelvi modell futtatása egy kártyát inkább rövid ideig foglalkoztat, mint folyamatosan — nagy terhelést jelent a generálás során, és kérések között tétlenkedik — így a folyamatos terhelés egy munkanap alatt általában jól a megadott érték alatt van.

A panel elfoglalja dual-slot, mérés 248 mm hosszú, és szükséges 1x 6-pin + 1x 8-pin. Érdemes ellenőrizni a gépben lévő házat és tápegységet, mivel a legnagyobb kártyáknak lényegesen több mindkettőre van szükségük, mint amit egy tipikus asztali gép biztosít.

Csatlakozik a PCIe 2.0 x16. A felület szabályozza, hogy a modell milyen gyorsan töltődik be a lemezről a kártyára, nem azt, hogy ott milyen gyorsan fut, így egy szűkebb kapcsolat néhány másodpercbe kerül a rendszerindításkor, és utána semmi.

Az extremitások

A legnagyobb AI modellek, amelyek futnak egy Tesla M2075

A legnagyobb open weight modellek, amelyek elférnek ezen a kártyán, legújabb elöl. Mindegyik a kártya által elérhető legjobb tömörítésben van megjelenítve..

  1. 01 Qwen3.5-9B 9B · Q3_K_M · Feb 2026 16.2 tok/s
  2. 02 NVIDIA-Nemotron-Nano-9B-v2 9B · Q3_K_M · Aug 2025 16.2 tok/s
  3. 03 Ovis2.5 9B 9B · Q3_K_M · Aug 2025 16.2 tok/s
  4. 04 GLM-4.1V-Thinking 9B · Q3_K_M · Aug 2025 16.2 tok/s
  5. 05 MamayLM 9B · Q3_K_M · Apr 2025 16.2 tok/s
  6. 06 GLM-4-9B-0414 9B · Q3_K_M · Apr 2025 16.2 tok/s
  7. 07 SimPO 9B · Q3_K_M · Nov 2024 16.2 tok/s
  8. 08 GLM-4V-9B 9B · Q3_K_M · Jun 2024 16.2 tok/s
  9. 09 Persimmon-8B 9.3B · Q3_K_M · Sep 2023 15.7 tok/s
  10. 10 Qwen-VL 9.6B · Q3_K_M · Aug 2023 15.2 tok/s

A leggyorsabb AI modellek egy Tesla M2075

Ahol ez a KÁRTYA a leggyorsabban állítja elő a tokeneket. A kisebb modellek itt dominálnak, mert minden token előállítása azt jelenti, hogy az egész modellt egyszer kell kiolvasni a memóriából..

  1. 01 Gemma 3 QAT 1B 1B · Q8_0 · 1.8 GB 54.1 tok/s
  2. 02 Gemma 3 1B 1B · Q8_0 · 1.8 GB 54.1 tok/s
  3. 03 LLama 3..2 Typhoon 2 1B 1B · Q8_0 · 1.8 GB 54.1 tok/s
  4. 04 OLMo-1B 1B · Q8_0 · 1.8 GB 54.1 tok/s
  5. 05 HGRN 1B (WT 103) 1B · Q8_0 · 1.8 GB 54.1 tok/s
  6. 06 Pythia-1b 1B · Q8_0 · 1.8 GB 54.1 tok/s
  7. 07 OpenELM-1.1B 1.1B · Q8_0 · 1.9 GB 50.1 tok/s
  8. 08 TinyLlama-1.1B (1T token checkpoint) 1.1B · Q8_0 · 1.9 GB 49.2 tok/s
  9. 09 TinyLlama-1.1B (3T token checkpoint) 1.1B · Q8_0 · 1.9 GB 49.2 tok/s
  10. 10 DeciCoder-1B 1.1B · Q8_0 · 1.9 GB 49.2 tok/s

Lépésről lépésre

Hogyan lehet kiszámolni a tokenek másodpercenként egy Tesla M2075

Nem kell semmit kézzel kiszámolnod — a gputps.com kalkulátor ezen az oldalon már kiszámította minden modelféleséghez, amit ez a kártya elbír. A válasz leolvasása hat lépést igényel..

  1. 01

    Keresd a modellt a táblázatban

    A táblázat felsorolja 280 modellek, amelyeket ez a kártya futtathat. Keresés név vagy méret szerint — a 27b beírása a paraméterek számán illeszkedik, még akkor is, ha a név soha nem mondja ki.

  2. 02

    Döntsön arról, hogy mennyi ideig tartanak a beszélgetései.

    Húzza el a csúszkát a tervezett beszélgetési hosszhoz, amin dolgozni kíván. A cache a beszélgetéssel nő, és egy kártyával szemben tart. 6 GB tehát a beállítást megéri jól csinálni.

  3. 03

    Válaszd ki, meddig szeretnéd tömöríteni.

    Minden modell a legjobb tömörítésnél van megjelenítve, amit ez a KÁRTYA elbír. Egy minimális minőség elrejti azokat, amelyek csak úgy férnek el, ha további szorításra kerülnek, mint amit te elfogadnál.

  4. 04

    Olvasd el a sebességet és a hatótávolságot

    A sebességek hibahatárokkal járnak okkal. A legjobb eset itt 54.1 tok/s on Gemma 3 QAT 1B. Ugyanaz a Kártya és Modell harminc és ötven százalékos eltérést mutat a következtetési futási idők között.

  5. 05

    Ellenőrizze a szabad helyet, mielőtt döntést hozna

    A Szoros azt jelenti, hogy ma működik; a Kényelmes azt jelenti, hogy még mindig működik, amikor a beszélgetés nő. Hasonlítsa össze, hogy az egyes modelleknek mire van szükségük egy elérhetővel. 6 GB.

  6. 06

    Nézd meg ugyanazt a modellt a másik oldalról

    Minden modell oldala megismétli ezt a számítást az egész katalógusra. Érdemes megnézni, mielőtt döntesz: megmutatja, mi fut még ugyanazzal a modellel, mellette Tesla M2075.

Válaszok

Tesla M2075 — gyakori kérdések

01

Tesla M2075— mi a memória-sávszélessége?

A memóriával rendelkező sávszélesség eléri 150 GB/s egy buszon keresztül a 384 bit. Ez a legjobb előrejelzője annak, hogy milyen gyorsan generál szöveget, mert minden egyes token előállítása azt jelenti, hogy az egész modellt egyszer el kell olvasni a memóriából.

02

Tesla M2075— Milyen típusú MEMORY-t használ?

Használja GDDR5 órára állítva 783 MHz. A HBM típusok adatközponti gyorsítókon találhatók, és sokkal nagyobb sávszélességgel rendelkeznek, mint a GDDR, amit asztali kártyákon használnak, ezért ugyanazon kapacitás mellett jelentősen gyorsabban generálnak tokeneket.

03

Tesla M2075— ki készíti?

Ez egy terméke a NVIDIA, a chip általi gyártásával TSMC, egy folyamatban 40 .

04

Tesla M2075— Mikor adták ki?

Megjelent a July 2011.

05

Tesla M2075— mennyi áramot fogyaszt?

A minősített kártya teljesítménye 225 W, és a javasolt rendszer tápegység 550 W. A szöveg generálása nagy terhelést jelent rövid időszakokra, és a kérések között inaktív, így egy munkamenet alatt a fogyasztás általában jól below van a megadott értéknél.

06

Tesla M2075— mennyi cache-e van?

Az L1 gyorsítótár 64 Kb, és az L2 gyorsítótár 0.75 MB. A Cache felszívja a memóriaforgalom egy részét, amely egyébként elérné a fő buszt, így egy nagyobb L2 szerény mértékben növeli a generálási sebességet, a sávszélesség által egyedül előre jelzett értékhez képest.

07

Tesla M2075— Támogatja a CUDA-t?

Igen. Jelentést ad a CUDA számítási képességről. 2.0, ami megelőzi a TENSOR CORES-t. A 7.0 és annál magasabb képességű modellek rendelkeznek tenzormagokkal, amelyeket a modern inferencia szoftver használ; ennél alacsonyabb szinten lassabb kódú utakat használ a kvantált modellekhez.

08

Tesla M2075— Milyen busz interfészt használ?

Használja PCIe 2.0 x16. Ez szabályozza, hogy milyen gyorsan töltődik be egy modell a kártyára, ahelyett, hogy azt nézné, milyen gyorsan fut, miután betöltődött, így ez néhány másodpercet vesz igénybe a rendszerindításkor, és semmit a generálás során.

09

Tesla M2075— jó helyi AI modellek futtatására?

Memóriája miatt kisebb modellekre korlátozódik, bár sávszélessége azt jelenti, hogy a generálás lassúnak fog tűnni a nagyobb modellek esetében. Összesen fut 280 a modellek számára, amelyeket nyomon követünk. Hogy ez elég-e, az teljesen attól függ, hogy melyik modellt szeretnéd - a fenti táblázat közvetlenül erre válaszol.

10

Tesla M2075— Futtathat egy modellt, ami nem fér el a VRAM-jában?

Fel lehet osztani, az átlépés a rendszer MEMÓRIÁBAN marad, a kártya mögött. 6 GB lehúzza az egészet, és az ezen az oldalon található számok egyike sem feltételezi azt.

11

Két Tesla M2075 kártyák kétszer olyan gyorsak lesznek?

A párosításuk fejlesztési lehetőséget biztosít a sebesség helyett: 12 GB egy GPU-val dolgozni, nem pedig kétszer annyi TOKEN másodpercenként — minden szám egyetlen KÁRTYÁRA vonatkozik.

12

Tesla M2075— Melyik AI modellt tud futtatni?

280 a 721 A nyomon követett open-weight nyelvi modellek elférnek ezen a kártyán, és helyben futtathatók. Az ezen az oldalon található táblázat minden egyes modellt felsorol, beleértve a szükséges memória mennyiségét, a futtatási kvantálást és a becsült generálási sebességet.

13

Tesla M2075— Melyik a legnagyobb AI modell, amit futtatni tud?

A katalógusunkban a legnagyobb modell, ami belefér, az Qwen-VL at 9.6B paraméterek, tömörített Q3_K_M. Körülbelül generál. 15.2 token másodpercenként és körülbelül 5.4 A kártya memória GB-ja.

14

Tesla M2075— mennyi token másodpercenként?

A modell függvénye. A leggyorsabb modell, amit itt követünk, az Gemma 3 QAT 1B körülbelül 54.1 tokenek másodpercenként, míg a nagyobb modellek arányosan lassabban futnak, mert minden token megköveteli az egész modell memória-ből való egyszeri kiolvasását. A sebességek becslések egyetlen beszélgetés egyidejűleg.

15

Tesla M2075— futtatható-e 7B modellek?

Igen. Például fut. Gemma 4 E4B at Q3_K_M, használva körülbelül 5.2 GB memória és körülbelül generálás 32.5 tokenek másodpercenként

16

Tesla M2075— mennyi VRAM-ja van?

Ez a KÁRTYA rendelkezik 6 GB -nak GDDR5. Körülbelül egy tizedet tartanak fenn az inference futási idő és a meghajtó, így körülbelül 5.4 GB elérhető egy AI modell számára és annak beszélgetéséhez.

A másik irány

Másik oldalról nézve?

Ez az oldal a hardverrel kezdődik. Ha már tudod, melyik AI modelt szeretnéd, és tudni szeretnéd, mi szükséges a futtatásához, Kezdje a MODELBŐL..

Minden GPU