Kimi K2.5 TPS-Rechner
Jede Karte unten wird gegen dieses Modell in der gewählten Kontextlänge und minimalen Qualität bewertet. Die Geschwindigkeit ist eine Schätzung für eine einzelne Anfrage, berechnet aus der Speicherbandbreite der Karte und der Größe des Modells, nachdem es komprimiert wurde..
Für dieses Modell berechnet
Welche GPUs können laufen Kimi K2.5?
Setze die Eingaben, lies die Antwort
Ein längerer Dialog benötigt mehr Speicher, was dieses Modell von kleineren Karten drängen kann..
Versteckt Karten, die nur für das Modell passen würden, indem es unter diesen Punkt komprimiert wird..
0 Karten stimmen überein
Berechnen| Benötigt | Quantisierung | Fit | |||||
|---|---|---|---|---|---|---|---|
|
Kein Modell in unserem Katalog kann dieses Modell mit diesen Einstellungen ausführen.. |
|||||||
Die Geschwindigkeiten sind Schätzungen für eine einzelne Anfrage – ein Gespräch zur Zeit – berechnet aus der Speicherbandbreite, der Modellgröße und der Quantisierung. Der tatsächliche Durchsatz variiert mit der Inferenzlaufzeit und deren Version. Die von Hardwareanbietern veröffentlichten Zahlen messen viele gleichzeitige Anfragen und sind wesentlich höher..
Aufzeichnen
Vollständige Spezifikation
Alles, was für dieses Modell aufgezeichnet wurde. Der Großteil beschreibt, wie es trainiert wurde, anstatt wie es läuft – nützlicher Kontext, um zu beurteilen, wie viel Arbeit darin steckt und wie es sich mit Modellen vergleicht, die in unterschiedlichem Maßstab erstellt wurden..
Ursprung
Wer hat dieses Modell erstellt, wo und wann es veröffentlicht wurde.
- Organisation
- Moonshot
- Typ der Organisation
- Industry
- Land
- China
- Veröffentlicht
- 2 February 2026
- Autoren
- Tongtong Bai, Yifan Bai, Yiping Bao, S.H. Cai, Yuan Cao, Y. Charles, H.S. Che, Cheng Chen, Guanduo Chen, Huarong Chen, Jia Chen, Jiahao Chen, Jianlong Chen, Jun Chen, Kefan Chen, Liang Chen, Ruijue Chen, Xinhao Chen, Yanru Chen, Yanxu Chen, Yicun Chen, Yimin Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Ziwei Chen, Dazhi Cheng, Minghan Chu, Jialei Cui, Jiaqi Deng, Muxi…
Was es tut
Die Problembereiche, für die das Modell entwickelt wurde. Ein Modell kann mehrere von jedem tragen.
- Domäne
- Language
- Aufgabe
- Language modeling/generation
Größe
Wie groß das Modell ist und wie viele Daten es trainiert wurde. Parameter sind die Werte, die entscheiden, ob es auf eine bestimmte Grafikkarte passt.
- Parameter
- 1T
- Modell/Modelle können auf der GPU nicht passen. Eng = kaum auszuführen, komfortabel = läuft problemlos mit Spielraum.
- tokens
"The model comprises 1.04 trillion total parameters"
Training-Berechnung
Die Berechnungen, die zum Trainieren des Modells durchgeführt werden, gemessen in Gleitkommaoperationen. Es ist ein Maß dafür, was der Trainingslauf gekostet hat, nicht dafür, wie schnell das fertige Modell Ihnen antwortet.
- Training-Berechnung
- 5.8 × 10²⁴ FLOP
Per section 3.2, "The joint pre-training stage continues from a near-end Kimi K2 checkpoint over additional 15T vision-text tokens at 4K sequence length" Kimi K2 was pretrained on 15T tokens. A near-end checkpoint of K2 was trained into K2.5 over another 15T tokens (or 15.2 to 15.5T tokens). This makes for a total of ~30T. There are an additional 1T tokens in "Stage 1" used to train the ViT encoder, which is likely much smaller than the full LLM, so we omit those tokens to calculate training c…
Der Trainingslauf
Was es physisch benötigte, um zu trainieren: welche Chips, wie viele, wie lange und was das aus der Steckdose zog.
- Trainingshardware
- NVIDIA H800 SXM5
Verfügbarkeit
Ob Sie das Modell erhalten und es auf Ihrer eigenen Hardware ausführen können, was entscheidet, ob eine der Grafikkartenfiguren auf dieser Seite zutrifft.
- Gewichte
- Open — downloadable
- Modellzugriff
- Open weights (unrestricted)
- Hugging Face
- moonshotai
Wie es klassifiziert ist
Labels, die auf das Quell-Dataset angewendet werden, wenn bemerkenswerte Modelle verfolgt werden, und wie zuversichtlich es in den Eintrag ist.
- Warum es verfolgt wird
- Discretionary
- Modell/Modelle können auf der GPU ausgeführt werden. Es passt nicht / wird nicht passen. Eng = kaum ausführbar, komfortabel = läuft problemlos mit Spielraum.
- Likely
Cost-competitive and widely used in the open-weight AI industry
Model/Modelle laufen nicht / wird nicht passen
Woher dieser Datensatz stammt und wann er zuletzt überprüft wurde.
- Referenz
- Kimi K2.5: Visual Agentic Intelligence
- Modell/Modelle können von der GPU nicht ausgeführt werden. Es passt nicht. Zu eng. Lauffähig. Bequem.
- 28 May 2026
Was die Zahlen bedeuten
Was nötig ist, um dieses Modell auszuführen
At 1T parameters, Kimi K2.5 is beyond what any single graphics card holds. Running it means either splitting it across several cards or renting hardware built for the job — 0 of the cards we track can hold it on their own, and all of them are datacentre parts.
Über dieses Modell
Kimi K2.5 was published by Moonshot, in China, in February 2026. It comes out of industry.
Es funktioniert in Deutsch und wird als Sprachmodellierung/-generierung aufgezeichnet.
The weights are published, so it can be downloaded and run on your own hardware indefinitely, offline, with no account attached. It is published under the moonshotai organisation on Hugging Face.
Wie es trainiert wurde
Training it took roughly 5.8 × 10²⁴ FLOP of computation, on NVIDIA H800 SXM5 — a measure of what producing the model cost, not of how fast it answers.
The reason it appears in this catalogue at all is discretionary.
Schritt für Schritt
Wie man eine GPU für Kimi K2.5
Die obige Tabelle hat bereits jede Karte, für die wir Spezifikationen haben, mit diesem Modell bewertet. Um zu Ihrer Antwort zu gelangen, sind sechs Schritte erforderlich..
-
01
Überprüfen, was es benötigt, bevor irgendetwas anderes.
Look at what Kimi K2.5 actually needs. No amount of processing power compensates for a card that cannot hold it.
-
02
Entscheide, wie lange deine Gespräche laufen
Set the context to what you will actually use. The cache grows with the conversation, and it is the usual reason Kimi K2.5 stops fitting a card that seemed fine.
-
03
Wähle, wie weit du es komprimieren möchtest.
Each card runs the least-compressed copy it can hold. Setting a floor drops the cards that only manage Kimi K2.5 by squeezing it further than you would want.
-
04
Vergleiche TPS, nicht Spezifikationen
Ranking by tokens per second for Kimi K2.5 follows memory bandwidth, not core counts.
-
05
Beachte den Spielraum, nicht nur die Passform.
The fit column separates cards that just manage Kimi K2.5 from those with room to spare. Buy for the second if the context might grow.
-
06
Überprüfen Sie die Karte von der anderen Seite
Every card name links to its own page, which runs the same calculation across the whole model catalogue. Worth a look before buying for Kimi K2.5 alone — a card is usually bought for more than one model.
Antworten
Kimi K2.5 — Häufige Fragen
Why does the quantisation differ between cards for Kimi K2.5?
A larger card holds a more accurate copy. Across the cards that run Kimi K2.5, 1 compression levels are used; the floor control above pins it to one.
How accurate are these Kimi K2.5 speed estimates?
Sie werden aus Spezifikationen berechnet, anstatt gemessen zu werden, und jeder hat einen Bereich – den Bereich unter jeder Zahl, zum Beispiel. Das gleiche Modell und die gleiche Karte variieren je nach Inference-Software und deren Version um dreißig bis fünfzig Prozent.
Is Kimi K2.5 open source?
Its weights are published, so Kimi K2.5 can be downloaded and run on your own hardware. Note that open weights is not the same as open source in the full sense — it says nothing about the training data, the training code, or the commercial terms attached.
How many parameters does Kimi K2.5 have?
Kimi K2.5 has 1T parameters. "The model comprises 1.04 trillion total parameters". That figure is the total, and it is what decides how much memory the model needs — roughly half a gigabyte per billion at the compression most people use.
Who created Kimi K2.5?
Kimi K2.5 was published by Moonshot, based in China, categorised as industry.
When was Kimi K2.5 released?
Kimi K2.5 was published in February 2026.
What is Kimi K2.5 used for?
Kimi K2.5 works in Language, and is recorded as handling language modeling/generation. Models frequently carry more than one of each, and the tags describe purpose rather than capability limits.
Where can I download Kimi K2.5?
Seine Gewichte sind unter der moonshotai Organisation auf Hugging Face veröffentlicht. Wir hosten keine Modellausgaben – diese Seite berechnet, welche Hardware benötigt wird, um sie auszuführen.
How much compute was used to train Kimi K2.5?
Around 5.8 × 10²⁴ FLOP, on NVIDIA H800 SXM5. That measures what producing the model cost and says nothing about how quickly it answers once trained — inference speed comes from memory bandwidth, not from the training budget.
Can I run Kimi K2.5 if it does not fit in my GPU?
It can be split between the card and system memory, but Kimi K2.5 generates painfully slowly that way — the nearest miss we calculate is short by 370.7 GB. Nothing on this page assumes offloading.
Would two GPUs run Kimi K2.5 faster?
A second card roughly doubles the memory available but not the generation rate. With 0 cards already able to run Kimi K2.5 alone, the case for pairing is weak.
Die andere Richtung
Von der anderen Seite betrachten?
Diese Seite beginnt vom Modell. Wenn Sie bereits eine Karte besitzen und alles erfahren möchten, was sie ausführen kann., Modell/Modelle laufen GPU AI-Modell. passt nicht/wird nicht passen. eng = kaum lauffähig, komfortabel = läuft problemlos mit Spielraum..