DeepSeek-R1 (May 2025) TPS kalkulátor

Nyitott súlyok DeepSeek 671B Paraméterek May 2025

Minden kártyát az alábbiak szerint értékelünk e modell alapján a választott kontextus hossza és minimális minőség szerint. A sebesség egy becslés egyetlen kérésre, amelyet a kártya memória sávszélessége és a modell mérete alapján számítunk ki, miután tömörítettük..

Kiszámítva ehhez a MODElhez

0 kártyák, amelyek futtatni tudják

818 kártyák, amelyek specifikációs adataink vannak

Melyik GPU képes futtatni DeepSeek-R1 (May 2025)?

Állítsa be a bemeneteket, olvassa el a választ

Egy hosszabb beszélgetés több memóriaigényt támaszt, ami kiszoríthatja ezt a modellt a kisebb kártyákról..

Elrejti azokat a GPU-kártyákat, amelyek csak a modellbe illeszkednének a compressziójuk ezen pont alá..

0 kártyák illeszkednek

Számítás
Szükséges Kvantisálás Illeszkedik

A katalógusunkban nincs olyan GPU, amely képes lenne futtatni ezt a modellt ezekkel a beállításokkal..

A sebességek egyetlen kérésre - egy beszélgetés egy időben - vonatkozó becslések, amelyeket a MEMORY BANDWIDTH, a MODEL SIZE és a QUANTISATION alapján számítanak ki. A valós áteresztőképesség változik az INFERENCE RUNTIME és annak verziója szerint. A HARDWARE VENDORS által közzétett számok sok párhuzamos kérést mérnek, és sokkal magasabbak..

Nyilvántartásban

Teljes specifikáció

Minden feljegyzett ezzel a modellel kapcsolatban. A legtöbbje azt írja le, hogyan képezték ki, nem pedig azt, hogyan fut — hasznos kontextus annak megítéléséhez, hogy mennyi munka ment bele, és hogyan viszonyul a más méretben épített modellekhez..

Eredet

Ki építette ezt a modellt, hol, és mikor publikálták.

Szervezet
DeepSeek
Szervezet típusa
Industry
Ország
China
Közölt
28 May 2025

Mit csinál

A probléma területek, amelyekre a modell készült. Egy modell több mindegyikből hordozhat.

Tartomány
Language
Feladat
Language modeling/generation, Code generation, Quantitative reasoning, Question answering
Alapmodell
DeepSeek-V3
Numerikus formátum
FP8

Méret

Mekkora a modell, és mennyi adatot használtak a betanításához. A paraméterek azok a számok, amelyek eldöntik, hogy az adott grafikus kártyára illeszkedik-e.

Paraméterek
671B

671B total 37B activated https://github.com/deepseek-ai/DeepSeek-R1/tree/main

Képzési adatok
14,800,000,000,000 tokens

Képzés számítás

A modell tanításához végrehajtott aritmetika, lebegőpontos műveletekben mérve. Ez a tanítási futás költségének mértéke, nem pedig annak, hogy mennyire gyorsan válaszol a kész modell.

Képzés számítás
4 × 10²⁴ FLOP

Estimates by Ege Erdil in Gradient Updates: https://epoch.ai/gradient-updates/what-went-into-training-deepseek-r1 "A dataset size of 14.8 trillion tokens is reasonable and in line with other models of this scale. Assuming that’s valid, the pretraining of this model would have required 6 * (37 billion) * (14.8 trillion) = 3e24 FLOP. If we assume DeepSeek’s training cluster consists of H800s with the PCIe form factor, then each should be capable of 1.5e15 FP8 per second, and the implied model FLOP…

Hogyan jött létre
Operation counting
Finomhangolás számítás
6.1 × 10²³ FLOP

6.1e23 FLOP from these estimations: https://epoch.ai/gradient-updates/what-went-into-training-deepseek-r1

A tréning futás

Ami fizikailag szükséges volt a betanításhoz: mely chipek, hány, mennyi ideig, és ez mit fogyasztott a falból.

Számítási költség
$6,770,000

Elérhetőség

Hogy meg tudja-e szerezni a modellt és futtatni a saját hardverén, ez dönt arról, hogy alkalmazhatóak-e a lap ezen oldalán feltüntetett grafikus kártya adatok.

Súlyok
Open — downloadable
Modell hozzáférés
Open weights (unrestricted)
Képzés kód
Unreleased

MIT licensed https://huggingface.co/deepseek-ai/DeepSeek-R1

Hugging Face
deepseek-ai

Hogyan van besorolva

Címkék a forráshalmazra, amelyeket a figyelemre méltó modellek nyomon követésekor alkalmaznak, és hogy mennyire biztos az adatbevitelben.

Valószínűleg 10²³ FLOP felett
Yes
Miért követik nyomon
Training cost,SOTA improvement

Best score on SuperCLUE Math6o in Jan 2025 https://www.superclueai.com/

Nyilvántartási bizalom
Confident

Források

Honnan származik ez a felvétel és mikor ellenőrizték utoljára.

Referencia
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Utoljára frissítve
11 February 2026

Mit jelentenek a számok

Mi szükséges ehhez a modellhez való futtatáshoz

DeepSeek-R1 (May 2025) eléri a paraméterek számát 671B. Ez túl van azon, amit bármelyik egyedi GPU kártya kezelni tud. A futtatása azt jelenti, hogy vagy több kártyára osztja, vagy olyan hardvert bérel, amelyet erre a feladatra terveztek, és minden olyan kártya, amely egyedül képes kezelni, egy adatközponti alkatrész. Az a szám, amely képes rá: 0.

Háttér

DeepSeek-R1 (May 2025) ki lett adva által DeepSeek, az országban rögzítve mint China, alatt May 2025. A kiadó kategóriája alá tartozik industry.

Működik a területen a Language, és úgy van rögzítve, mint a feladat végrehajtása language modeling/generation, Code generation, Quantitative reasoning, Question answering.

Ahelyett, hogy nulláról lenne betanítva, az származik DeepSeek-V3. A legtöbb modell ezen a skálán egy meglévő alaphoz van igazítva, ahelyett, hogy semmiből épült volna.

A közzétett súlyok azt jelentik, hogy a modell a te gépeden fut, nem pedig valaki másén, ami lehetővé teszi az alábbi hardverkérdés megválaszolását. A Hugging Face-en az alábbi szervezet alatt van publikálva deepseek-ai.

Képzés és származás

A létrehozásához körülbelül összesítő aritmetikára volt szükség. 4 × 10²⁴ FLOP. Ez a szám azt méri, hogy mennyibe került a modell előállítása, és nincs hatással arra, hogy milyen gyorsan válaszol.

Körülbelül egy korpuszon lett betanítva 14,800,000,000,000 szöveg tokenjei

Egy különös okból nyomon követik az alapul szolgáló adatbázisban: training cost,SOTA improvement.

Lépésről lépésre

Hogyan válasszunk GPU-t a DeepSeek-R1 (May 2025)

A fenti táblázat már értékelte az összes kártyát, amelynek specifikációi elérhetők ennek a modellen. A válaszod megszerzése hat lépést igényel..

  1. 01

    Kezdj a GPU VRAM oszloptól.

    Minden kártyát itt leellenőriztünk a következőkkel szemben DeepSeek-R1 (May 2025). A kapacitás a kapu — egy kártya vagy tartalmazza, vagy nem.

  2. 02

    Döntsön arról, hogy mennyi ideig tartanak a beszélgetései.

    A hosszabb beszélgetések memóriaigénye van a súlyok szükségletén kívül. Húzd el a csúszkát a valódi munkahosszodra, mielőtt bármelyik sort megbízhatónak tartanád. DeepSeek-R1 (May 2025).

  3. 03

    Döntsd el, mennyi tömörítést fogadsz el.

    A tömörítés az, ami lehetővé teszi, hogy egy modell kisebb kártyákra illeszkedjen, bizonyos költséggel a pontosság terén.. A minimális minőség beállítása eldobja azokat a kártyákat, amelyek csak úgy tudják kezelni, hogy tovább szorítanak, mint amit szeretnél, és egy szinten tartja az összehasonlítást.

  4. 04

    Hasonlítsd össze a TOKENS PER SECOND-t, ne a SPECIFICATIONS-t.

    A sebességsorrend lényegében egy sorrend a MEMÓRIA-SÁV szerint, a DeepSeek-R1 (May 2025). Nem fog illeszkedni egy gaming rendeléshez, mert a generálás a memória sávszélesség által kötött.

  5. 05

    Olvasd el az illeszkedés oszlopot utoljára.

    A megfelelő oszlop elválasztja azokat a kártyákat, amelyek épp hogy elboldogulnak, azoktól, amelyeknek van szabad helyük, az esetében DeepSeek-R1 (May 2025). A Kényelmes azt jelenti, hogy később bővítheted a contextet. Ez a különbség fontosabb, mint néhány token másodpercenként, így kényelmeset vásárolj, ha ezt várod.

  6. 06

    Nézd meg, mit futtat még az a kártya.

    Minden kártyanév egy saját oldalra mutat, amely ugyanazt a számítást végzi el az egész modell kataloguson. Egy kártyát általában több modellhez is vásárolnak, ezért érdemes megnézni vásárlás előtt. DeepSeek-R1 (May 2025).

Válaszok

DeepSeek-R1 (May 2025) — gyakori kérdések

01

DeepSeek-R1 (May 2025)— Mire használják?

Működik a területen a Language, és rögzítve van, hogy kezeli a feladatot language modeling/generation, Code generation, Quantitative reasoning, Question answering. Ezek azok a területek, amelyek köré tervezték; ezek a szándékot írják le, nem pedig egy szigorú határt.

02

DeepSeek-R1 (May 2025)— Hol tudom letölteni?

Súlyait a Hugging Face-en tette közzé, a szervezet alatt deepseek-ai. Nem tárolunk modell fájlokat — ez az oldal kiszámolja, hogy milyen hardver szükséges a futtatásukhoz.

03

DeepSeek-R1 (May 2025)— mennyi számítási kapacitást használtak annak a betanításához?

A képzés körülbelül elfogyasztott 4 × 10²⁴ FLOP. Ez azt méri, hogy mennyibe került a modell előállítása, és semmit nem mond arról, hogy milyen gyorsan válaszol, miután betanult — a következtetési sebesség a memória sávszélességéből származik, nem az edzési költségvetésből.

04

DeepSeek-R1 (May 2025)— Futtathatom, ha nem fér el a GPU-mban?

Részben. Azok a rétegek, amelyek nem férnek el a GPU VRAM-ban, a rendszer memóriájában ülnek és a sebesség egy töredékén futnak, így egy túlnyomórészt áthelyezett AI model használata ritkán éri meg. A legközelebbi hiba, amit számítunk, alulmúlja 147.5 GB Minden ábra azt feltételezi, hogy az egész model a kártyán tartózkodik.

05

DeepSeek-R1 (May 2025)— Futtatna-e két GPU gyorsabban?

Egy második Kártya körülbelül megduplázza a rendelkezésre álló MEMÓRIÁT, de nem a generálási sebességet. A szám, amely már képes egyedül futtatni: 0. Tehát egy második KÁRTYA ritkán a megoldás itt.

06

DeepSeek-R1 (May 2025)— miért különbözik a kvantálás a kártyák között?

Minden kártya a lehető legkevésbé tömörített másolatát futtatva jelenik meg, amit képes tárolni. A kártyákon elférő különböző tömörítési szintek száma: 1. A nagyobb kártyák a pontosabb verziót kapják, és a minőségi küszöb felett a összehasonlítást egy szinten rögzíti.

07

DeepSeek-R1 (May 2025)— Mennyire pontosak ezek a sebességbecslések?

Minden szám a memória sávszélességből és a modell méretéből származik, nem benchmarkolták, ezért mindet tartományként tették közzé, nem pedig egyetlen számként. Egy például: a távolság minden egyes szám alatt. Ugyanaz a modell és kártya harminc és ötven százalék között változik a következtetési szoftvertől és annak verziójától függően.

08

DeepSeek-R1 (May 2025)— Nyílt forráskódú?

Súlyai közzétételre kerültek, így letölthető és futtatható a saját hardvereden. Ne feledd, hogy az open weight nem azonos az open source teljes értelmében — nem mond semmit a tanulási adatokkal, a tanulási kóddal vagy a kereskedelmi feltételekkel kapcsolatban.

09

DeepSeek-R1 (May 2025)— Hány paramétere van?

Paraméterszáma 671B. 671B total 37B activated https://github.com/deepseek-ai/DeepSeek-R1/tree/main. Ez a szám a teljes összeg, és ez határozza meg, hogy mennyi VRAM-ra van szüksége a modelleknek — körülbelül fél gigabájt milliárdonként a legtöbb ember által használt tömörítési módban.

10

DeepSeek-R1 (May 2025)— Ki készítette ezt?

Kiadta DeepSeek, alapján China, egy szervezet, amelyet kategorizáltak mint industry.

11

DeepSeek-R1 (May 2025)— Mikor adták ki?

Kibocsátották a May 2025.

Forrás

Eredeti kiadvány

Az utolsó frissítés időpontja 11 February 2026

A másik irány

Másik oldalról nézve?

Ez az oldal a modellel kezdődik. Ha már van kártyád, és szeretnéd tudni, hogy mindent futtat-e, Kezdj a hardverből..