Pangu Ultra
Aucune estimation
Aucune exigence matérielle pour ce modèle
Les poids de ce modèle n'ont pas été publiés, donc il ne peut pas être téléchargé ou exécuté sur votre propre matériel à aucune taille. Il n'est accessible que par l'intermédiaire de son fournisseur, et aucun changement de carte graphique ne modifie cela..
Enregistrement
Spécifications complètes
Tout est enregistré pour ce modèle. La plupart décrit comment il a été entraîné plutôt que comment il fonctionne — un contexte utile pour juger combien de travail a été investi, et comment il se compare avec des modèles construits à une échelle différente..
Origine
Qui a construit ce modèle, où, et quand il a été publié.
- Organisation
- Huawei
- Type d'organisation
- Industry
- Pays
- China
- Publié
- 10 April 2025
- Auteurs
- Yichun Yin, Wenyong Huang, Kaikai Song, Yehui Tang, Xueyu Wu, Wei Guo, Peng Guo, Yaoyuan Wang, Xiaojun Meng, Yasheng Wang, Dong Li, Can Chen, Dandan Tu, Yin Li, Fisher Yu, Ruiming Tang, Yunhe Wang, Baojun Wang, Bin Wang, Bo Wang, Boxiao Liu, Changzheng Zhang, Duyu Tang, Fei Mi, Hui Jin, Jiansheng Wei, Jiarui Qin, Jinpeng Li, Jun Zhao, Liqun Deng, Lin Li, Minghui Xu, Naifu Zhang, Nianzu Zheng, Qian…
Ce qu'il fait
Les domaines problématiques pour lesquels le modèle a été conçu. Un modèle peut contenir plusieurs de chacun.
- Domaine
- Language
- Tâche
- Code generation, Language modeling/generation
Taille
Quelle est la taille du modèle et combien de données il a été formé. Les paramètres sont le chiffre qui décide s'il convient à une carte graphique donnée.
- paramètres
- 135B
- Données d'entraînement
- 13,200,000,000,000 tokens
- Taille de lot
- 8,388,608
13.2 trillion tokens
2048 * 4096
Calcul de formation
L'arithmétique effectuée pour entraîner le modèle, mesurée en opérations en virgule flottante. C'est une mesure du coût de l'exécution de l'entraînement, pas de la rapidité avec laquelle le modèle fini vous répond.
- Calcul de formation
- 1.1 × 10²⁵ FLOP
- Comment cela a été établi
- Operation counting,Comparison with other models
When compared to Llama 3.1 405B, Pangu Ultra achieves better scores on most of the challenging benchmarks, while utilizing only about 29% of the training FLOPs required by Llama 405B. Compute = 6 FLOP/token/param * 135e9 params *13.2e12 tokens = 1.069200e+25 FLOP This is consistent with 29% of Llama 405B's compute: 3.8e25*0.29=1.1e25.
L'exécution de formation
Ce qu'il a physiquement fallu pour entraîner : quels chips, combien, pendant combien de temps, et ce que cela a tiré du secteur.
- Matériel d'entraînement
- Huawei Ascend 910B
- Chips utilisés
- 8,192
- Utilisation du matériel
- MFU 52.0%
- Consommation d'énergie
- 6.4 MW
"Through careful tuning of load balancing across PP and VPP stages, we are able to achieve approximately 43% MFU on an 8,192 NPU cluster as a baseline." ... "Overall, we achieve over 52% Model FLOPs Utilization (MFU) when training Pangu Ultra on 8,192 Ascend NPUs."
Disponibilité
Que vous puissiez obtenir le modèle et l'exécuter sur votre propre matériel, ce qui détermine si l'un des chiffres de la carte graphique sur cette page s'applique.
- Poids
- Closed — provider access only
- Accès au modèle
- Hosted access (no API)
- Code d'entraînement
- Unreleased
"Our model and system will be available for our commercial customers"
Comment il est classé
Étiquettes que le ensemble de données source applique lors du suivi de modèles notables, et à quel point il est confiant dans l'entrée.
- Probablement au-dessus de 10²³ FLOP
- Yes
- Pourquoi c'est suivi
- SOTA improvement
- Confiance d'enregistrement
- Confident
- Citations
- 16
A closer examination reveals that Pangu Ultra excels on Chinese benchmarks, surpassing both Qwen 2.5 72B and DeepSeek V3, the current best-performing Chinese model. In addition, when compared to Llama 3.1 405B, Pangu Ultra achieves better scores on most of the challenging benchmarks, while utilizing only about 29% of the training FLOPs required by Llama 405B. These results suggest the effectiveness of our model architecture and the high quality of our training data. Table 3, Tabke 4: seems that…
Sources
D'où vient cet enregistrement et quand a-t-il été vérifié pour la dernière fois.
- Référence
- Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs
- Dernière mise à jour
- 25 May 2026
Ce que les chiffres signifient
Ce que ce modèle est
Pangu Ultra a été publié par Huawei, dans le pays enregistré comme China, durant April 2025. Cela provient d'une organisation classée comme industry.
Il fonctionne dans le domaine de Language, et est enregistré comme exécutant la tâche de code generation, Language modeling/generation.
Ses poids n'ont jamais été publiés, donc il ne peut être atteint que par son fournisseur. Aucun changement de carte graphique ne change cela.
Comment il a été entraîné
L'entraînement a nécessité un budget de calcul d'environ 1.1 × 10²⁵ FLOP, sur matériel enregistré comme Huawei Ascend 910B. Ce chiffre mesure le coût de production du modèle, et n'a aucune incidence sur la vitesse de réponse.
L'entraînement a consommé un corpus d'environ 13,200,000,000,000 jetons de texte
La raison pour laquelle il apparaît dans ce catalogue. sOTA improvement.
Réponses
Pangu Ultra — questions courantes
Pangu Ultra— qui l'a créé ?
Il a été publié par Huawei, basé sur China, une organisation catégorisée comme industry.
Pangu Ultra— quand a-t-il été publié ?
Il a été publié dans April 2025.
Pangu Ultra— à quoi ça sert ?
Il fonctionne dans le domaine de Language, et est enregistré comme gérant la tâche de code generation, Language modeling/generation. Ce sont les domaines autour desquels il a été conçu ; ils décrivent l'intention plutôt qu'une limite stricte.
Pangu Ultra— combien de puissance de calcul a été utilisée pour l'entraîner ?
L'entraînement a consommé environ 1.1 × 10²⁵ FLOP, sur matériel enregistré comme Huawei Ascend 910B. Cela mesure ce que coûte la production du modèle et ne dit rien sur la rapidité avec laquelle il répond une fois entraîné — la vitesse d'inférence provient de la bande passante mémoire, et non du budget d'entraînement.
Pangu Ultra— Quelle GPU ai-je besoin pour l'exécuter ?
Aucun. C'est un modèle fermé - ses poids n'ont jamais été publiés, il ne peut donc pas être téléchargé ou exécuté sur votre propre matériel à aucun prix. Il n'est accessible que par son fournisseur.
Pangu Ultra— est-ce que c'est open source ?
Non. Ses poids n'ont pas été publiés, donc il n'existe que sous forme de service contrôlé par son propriétaire.
Pangu Ultra— combien de paramètres cela a-t-il ?
Il a un nombre de paramètres de 135B. Ce chiffre est le total, et c'est ce qui détermine combien de mémoire le modèle nécessite — environ un demi-gigaoctet par milliard à la compression que la plupart des gens utilisent.
L'autre direction
Regardez-le de l'autre côté ?
Cette page commence par le modèle. Si vous possédez déjà une carte et souhaitez savoir tout ce qu'elle exécutera., commencez par le matériel à la place.