Llama Nemotron Ultra 253B TPS kalkulátor

Nyitott súlyok NVIDIA 253B Paraméterek March 2025

Minden kártyát az alábbiak szerint értékelünk e modell alapján a választott kontextus hossza és minimális minőség szerint. A sebesség egy becslés egyetlen kérésre, amelyet a kártya memória sávszélessége és a modell mérete alapján számítunk ki, miután tömörítettük..

Kiszámítva ehhez a MODElhez

9 kártyák, amelyek futtatni tudják

818 kártyák, amelyek specifikációs adataink vannak

Legkisebb kártya, ami elfér

H200 NVL

141 GB · Q3_K_M · 22.1 tok/s

Leggyorsabb kártya

B200

30.9 tok/s · 180 GB

Melyik GPU képes futtatni Llama Nemotron Ultra 253B?

Állítsa be a bemeneteket, olvassa el a választ

Egy hosszabb beszélgetés több memóriaigényt támaszt, ami kiszoríthatja ezt a modellt a kisebb kártyákról..

Elrejti azokat a GPU-kártyákat, amelyek csak a modellbe illeszkednének a compressziójuk ezen pont alá..

9 kártyák illeszkednek

Számítás
Szükséges Kvantisálás Illeszkedik
30.9 tok/s

19–49 · alacsony bizalom

B200 NVIDIA 180 GB 8,000 GB/s Jan 2024 153.8 GB Q4_K_M Szoros
22.1 tok/s

13–35 · alacsony bizalom

H200 NVL NVIDIA 141 GB 4,890 GB/s Nov 2024 124.3 GB Q3_K_M Szoros
22.1 tok/s

13–35 · alacsony bizalom

H200 SXM 141 GB NVIDIA 141 GB 4,890 GB/s Nov 2024 124.3 GB Q3_K_M Szoros
19.5 tok/s

12–31 · alacsony bizalom

B300 NVIDIA 288 GB 8,000 GB/s Sep 2025 212.7 GB Q6_K Kényelmes
16.1 tok/s

10–26 · alacsony bizalom

Radeon Instinct MI300X AMD 192 GB 5,325 GB/s Dec 2023 153.8 GB Q4_K_M Szoros
16.1 tok/s

10–26 · alacsony bizalom

Radeon Instinct MI308X AMD 192 GB 5,325 GB/s Dec 2023 153.8 GB Q4_K_M Szoros
15.5 tok/s

9–25 · alacsony bizalom

Radeon Instinct MI350X AMD 288 GB 8,190 GB/s Jan 2025 212.7 GB Q6_K Kényelmes
15.5 tok/s

9–25 · alacsony bizalom

Radeon Instinct MI355X AMD 288 GB 8,190 GB/s Jan 2025 212.7 GB Q6_K Kényelmes
11.4 tok/s

7–18 · alacsony bizalom

Radeon Instinct MI325X AMD 256 GB 6,000 GB/s Oct 2024 212.7 GB Q6_K Szoros

A sebességek egyetlen kérésre - egy beszélgetés egy időben - vonatkozó becslések, amelyeket a MEMORY BANDWIDTH, a MODEL SIZE és a QUANTISATION alapján számítanak ki. A valós áteresztőképesség változik az INFERENCE RUNTIME és annak verziója szerint. A HARDWARE VENDORS által közzétett számok sok párhuzamos kérést mérnek, és sokkal magasabbak..

Nyilvántartásban

Teljes specifikáció

Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
NVIDIA
Szervezet típusa
Industry
Ország
United States of America
Közölt
18 March 2025
Szerzők
Akhiad Bercovich, Itay Levy, Izik Golan, Mohammad Dabbah, Ran El-Yaniv, Omri Puny, Ido Galil, Zach Moshe, Tomer Ronen, Najeeb Nabwani, Ido Shahaf, Oren Tropp, Ehud Karpas, Ran Zilberstein, Jiaqi Zeng, Soumye Singhal, Alexander Bukharin, Yian Zhang, Tugrul Konuk, Gerald Shen, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Yoshi Suhara, Olivier Delalleau, Zijia Chen, Zhilin Wang, David Mosallanezhad, A…

Mit csinál

A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.

Tartomány
Language
Feladat
Language modeling/generation, Question answering, Quantitative reasoning, Code generation, Neural Architecture Search - NAS
Alapmodell
Llama 3.1-405B

Méret

Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.

Paraméterek
253B

253B "Dense decoder-only Transformer model Network Architecture: Llama-3.1-405B-Instruct, customized through Neural Architecture Search (NAS) **This model was developed based on Llama-3.1-405B-Instruct ** This model has 253B model parameters."

Képzési adatok
603,000,000,000 tokens

KD + Continued Training: "LN-Ultra is first trained with knowledge distillation for 65B tokens using the same distillation dataset, followed by 88B tokens of continued training on the Nemotron-H phase 4 pretraining dataset (NVIDIA et al., 2025)." (from the paper) Reasoning training data (SFT): for Super model (from the blog) "60B tokens of synthetic data (representing 4M of the 30M generated samples)" -> the entire dataset is ~450B tokens (Ultra model is likely to be trained on the entire dat…

Képzés számítás

A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.

Képzés számítás
3.9 × 10²⁵ FLOP

*Training compute figure is total lifetime (Meta + Nvidia) compute, not incremental Nvidia training compute* Total training compute: 3.8e+25 FLOP (base model) + 1.11e+24 FLOP (fine-tuning) = 3.9e25 FLOP See calculation in the finetune compute notes.

Hogyan jött létre
Operation counting
Finomhangolás számítás
1.1 × 10²⁴ FLOP

Knowledge Distillation + Continued pre-training + SFT: 6 FLOP / parameter / token * 253000000000 parameters * 6033000000000 tokens [see dataset size notes] = 9.15354e+23 FLOP RL: "the whole training takes approximately 140k H100 hours" 989400000000000 FLOP / sec / GPU [bf16] * 140000 GPU-hours * 3600 sec / hour * 0.4 [assumed utilization] = 1.9946304e+23 FLOP Total: 9.15354e+23 FLOP + 1.9946304e+23 FLOP = 1.114817e+24 FLOP

Elérhetőség

Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (restricted use)
Képzés kód
Unreleased

GOVERNING TERMS: Your use of this model is governed by the NVIDIA Open Model License. Additional Information: Llama 3.3 Community License Agreement. Built with Llama. https://huggingface.co/nvidia/Llama-3_1-Nemotron-Ultra-253B-v1

Hugging Face
nvidia

Hogyan van besorolva

Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.

Határmodell
Yes
Valószínűleg 10²³ FLOP felett
Yes
Nyilvántartási bizalom
Likely

Források

Honnan származik ez a felvétel és mikor ellenőrizték utoljára.

Referencia
Ultra is 253B distilled from Llama 3.1 405B for maximum agentic accuracy on multi-GPU data center servers.
Utoljára frissítve
21 July 2026

Az extremitások

Mit jelentenek a számok

Ami szükséges a futtatásához

Minimális kártya

H200 NVL

Szükséges memória

124.3 GB

Leggyorsabb

30.9 tok/s

Llama Nemotron Ultra 253B eléri a paraméterek számát 253B. Ez túl van azon, amit bármelyik egyedi GPU kártya kezelni tud. A futtatása azt jelenti, hogy vagy több kártyára osztja, vagy olyan hardvert bérel, amelyet erre a feladatra terveztek, és minden olyan kártya, amely egyedül képes kezelni, egy adatközponti alkatrész. Az a szám, amely képes rá: 9.

A legkevesebb hardver, ami működik, az H200 NVL, memória kapacitással rendelkezik 141 GB, futtatás egy tömörítési arányon Q3_K_M és körülbelül előállítva 22.1 tokenek másodpercenként

A másik végén ül B200, nagyjából generálás 30.9 másodpercenkénti tokenek egy memória sávszélesség erejében 8,000 GB/s.

Honnan jött

Llama Nemotron Ultra 253B ki lett adva által NVIDIA, az országban rögzítve mint United States of America, alatt March 2025. A kiadó kategóriája alá tartozik industry.

Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling/generation, Question answering, Quantitative reasoning, Code generation, Neural Architecture Search - NAS.

Ahelyett, hogy nulláról lenne betanítva, az származik Llama 3.1-405B. A legtöbb modell ezen a skálán egy meglévő alaphoz van igazítva, ahelyett, hogy semmiből épült volna.

A súlyok közzétéve vannak, így letölthető és futtatható a saját hardveren határozatlan ideig, offline, felhasználói fiók nélkül. A Hugging Face-en az alábbi szervezet alatt van publikálva nvidia.

A sebességek megértése

Minden olyan kártya esetében, amely képes futtatni, a közép tartományban ül 16.1 másodpercenkénti tokenek 9 tőlük

Ez egy sűrű modell, így minden paramétert minden előállított tokenhez elolvasnak. Ez szinte pontosan nyomon követi a memória-sávszélességet — egy kártya, amelynek kétszer akkora a sávszélessége, körülbelül kétszer olyan gyorsan generál.

Itt a memória méret alapján van megbecsülve, nem pedig az architektúrából számítva, amely nincs rögzítve ennél a modellnél — a számok tájékoztató jellegűek, nem pontosak.

Képzés és származás

A képzés futás körülbelül 3.9 × 10²⁵ FLOP. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.

A tanító készlet kb. futott 603,000,000,000 szöveg tokenjei

Lépésről lépésre

Hogyan válasszunk GPU-t a Llama Nemotron Ultra 253B

A fenti táblázat már értékelte az összes kártyát, amelynek specifikációi elérhetők ennek a modellen. A válaszod megszerzése hat lépést igényel..

  1. 01

    Nézd meg, mire van szüksége, mielőtt bármi mást tennél.

    Minden kártyát itt leellenőriztünk a következőkkel szemben Llama Nemotron Ultra 253B, körülbelül szükséges 124.3 GB a tömörítésnél Q3_K_M. A kapacitás a kapu — egy kártya vagy tartalmazza, vagy nem.

  2. 02

    Döntsön arról, hogy mennyi ideig tartanak a beszélgetései.

    A beszélgetés is elfoglalja a VRAM-ot, és ahogy halad, nő. Állítsa be a csúszkát a várt hosszúságra, mert hosszú kontextusnál egy kártya, amely könnyen kezeli a rövid kérdéseket, lemaradhat. Llama Nemotron Ultra 253B.

  3. 03

    Állítsa be a minőségi minimumot

    A kvantálási oszlop kártyánként változik, mert egy nagyobb kártya pontosabb másolatot tartalmaz., elérni egy tömörítést a Q3_K_M a legkisebb kártyán, ami elfér. A minimális minőség beállítása eldobja azokat a kártyákat, amelyek csak úgy tudják kezelni, hogy tovább szorítanak, mint amit szeretnél, és egy szinten tartja az összehasonlítást.

  4. 04

    Hasonlítsd össze a TOKENS PER SECOND-t, ne a SPECIFICATIONS-t.

    A sebességsorrend lényegében egy sorrend a MEMÓRIA-SÁV szerint, a Llama Nemotron Ultra 253B. Nem fog illeszkedni egy gaming rendeléshez, mert a generálás a memória sávszélesség által kötött. A listát vezető KÁRTYA B200, at 30.9 tok/s

  5. 05

    Nézd a mozgásteret, ne csak a passzolást.

    Egy szűk elhelyezés fut, de nem hagy semmit egy hosszabb beszélgetésre, az esetében Llama Nemotron Ultra 253B. A Kényelmes azt jelenti, hogy később bővítheted a contextet. Ez a különbség fontosabb, mint néhány token másodpercenként, így kényelmeset vásárolj, ha ezt várod.

  6. 06

    Nézd meg, mit futtat még az a kártya.

    Egy KÁRTYA végigkövetése a saját oldaláig megmutatja az összes többi modellt, amelyet el tud tartani, ami az a kérdés, ami felmerül, miután döntöttél. Llama Nemotron Ultra 253B.

Válaszok

Llama Nemotron Ultra 253B — gyakori kérdések

01

Llama Nemotron Ultra 253B— Milyen GPU-ra van szükségem, hogy futtathassam?

A katalógusunk legkisebb kártyája, ami ezt tartja, az H200 NVL, memória kapacitással rendelkezik 141 GB. A modell egy tömörítéssel fut. Q3_K_M használva körülbelül 124.3 GB, és körülbelül 22.1 másodpercenkénti tokenek. A kártyák összes száma, amelyek képesek futtatni. 9.

02

Llama Nemotron Ultra 253B— mennyi idő alatt fut a GPU-n?

A kártyától függ. A leggyorsabb, amit számolunk, az B200, körülbelül 30.9 tokenek másodpercenként; a leglassabb, ami még fut, jelentősen kevesebbet képes kezelni. Az olvasási sebesség körülbelül tíz token másodpercenként, és a kártyák száma, amelyek ezt meg tudják tisztítani: 9.

03

Llama Nemotron Ultra 253B— mennyi VRAM-ra van szüksége?

Kb. 124.3 GB tömörítési arányban Q3_K_M, melyik az a legkisebb KÁRTYA, amelyik futtatni tudja. Kevesebb tömörítés több szükséges: a fentebbi memória oszlop számai minden KÁRTYÁRA újraszámításra kerülnek, mert mindegyik tartalmazza a legkevésbé tömörített verziót, amit csak tud.

04

Llama Nemotron Ultra 253B— Nyílt forráskódú?

Súlyai közzétételre kerültek, így letölthető és futtatható a saját hardvereden. Ne feledd, hogy az open weight nem azonos az open source teljes értelmében — nem mond semmit a tanulási adatokkal, a tanulási kóddal vagy a kereskedelmi feltételekkel kapcsolatban.

05

Llama Nemotron Ultra 253B— Hány paramétere van?

Paraméterszáma 253B. 253B "Dense decoder-only Transformer model Network Architecture: Llama-3.1-405B-Instruct, customized through Neural Architecture Search (NAS) **This model was developed based on Llama-3.1-405B-Instruct ** This model has 253B model parameters.". Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.

06

Llama Nemotron Ultra 253B— Ki készítette ezt?

Kiadta NVIDIA, alapján United States of America, egy szervezet, amelyet kategorizáltak mint industry.

07

Llama Nemotron Ultra 253B— Mikor adták ki?

Kibocsátották a March 2025.

08

Llama Nemotron Ultra 253B— Mire használják?

Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling/generation, Question answering, Quantitative reasoning, Code generation, Neural Architecture Search - NAS. A modellek gyakran több mint egyet hordoznak mindegyikből, és a címkék a célra, nem pedig a képességek határaira utalnak.

09

Llama Nemotron Ultra 253B— Hol tudom letölteni?

Súlyait a Hugging Face-en tette közzé, a szervezet alatt nvidia. Nem tárolunk modell fájlokat — ez az oldal kiszámolja, hogy milyen hardver szükséges a futtatásukhoz.

10

Llama Nemotron Ultra 253B— mennyi számítási kapacitást használtak annak a betanításához?

A képzés körülbelül elfogyasztott 3.9 × 10²⁵ FLOP. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.

11

Llama Nemotron Ultra 253B— Futtathatom, ha nem fér el a GPU-mban?

Részben. Azok a rétegek, amelyek nem férnek el a GPU VRAM-ban, a rendszer memóriájában ülnek és a sebesség egy töredékén futnak, így egy túlnyomórészt áthelyezett AI model használata ritkán éri meg. A legközelebbi hiba, amit számítunk, alulmúlja 38.6 GB Minden ábra azt feltételezi, hogy az egész model a kártyán tartózkodik.

12

Llama Nemotron Ultra 253B— Futtatna-e két GPU gyorsabban?

A kapacitás kártyánként összeadódik; a teljesítmény nem. A kártyák számának már saját magukban tartva: 9. Tehát egy második KÁRTYA ritkán a megoldás itt.

13

Llama Nemotron Ultra 253B— miért különbözik a kvantálás a kártyák között?

Mivel a kapacitás változik, úgy az is, hogy mennyire kell összenyomni. A fenti táblázatban lévő különböző szintek száma: 3. A nagyobb kártyák a pontosabb verziót kapják, és a minőségi küszöb felett a összehasonlítást egy szinten rögzíti.

14

Llama Nemotron Ultra 253B— Mennyire pontosak ezek a sebességbecslések?

Minden szám a memória sávszélességből és a modell méretéből származik, nem benchmarkolták, ezért mindet tartományként tették közzé, nem pedig egyetlen számként. Egy például: 19–49 tok/s a fájlban B200. Ugyanaz a modell és kártya harminc és ötven százalék között változik a következtetési szoftvertől és annak verziójától függően.

Forrás

Eredeti kiadvány

Az utolsó frissítés időpontja 21 July 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..