Gopher (280B)
Keine Schätzung
Keine Hardwareanforderungen für dieses Modell
Die Gewichte für dieses Modell wurden nicht veröffentlicht, daher kann es nicht heruntergeladen oder auf Ihrer eigenen Hardware in beliebiger Größe betrieben werden. Es ist nur über seinen Anbieter erreichbar, und keine Grafikkarte ändert das..
Aufgezeichnet
Volle Spezifikation
Alles, was in unserer Datenbank für dieses Modell aufgezeichnet ist. Der Großteil beschreibt, wie es trainiert wurde, anstatt wie es läuft — nützlicher Kontext zur Beurteilung, wie viel Arbeit darin steckt und wie es sich mit Modellen vergleicht, die in einem anderen Maßstab erstellt wurden..
Ursprung
Wer hat dieses Modell gebaut, wo und wann es veröffentlicht wurde.
- Organisation
- DeepMind
- Organisationsart
- Industry
- Land
- United Kingdom of Great Britain and Northern Ireland
- Veröffentlicht
- 8 December 2021
- Autoren
- Jack W. Rae, Sebastian Borgeaud, Trevor Cai, Katie Millican, Jordan Hoffmann, Francis Song, John Aslanides, Sarah Henderson, Roman Ring, Susannah Young, Eliza Rutherford, Tom Hennigan, Jacob Menick, Albin Cassirer, Richard Powell, George van den Driessche, Lisa Anne Hendricks, Maribeth Rauh, Po-Sen Huang, Amelia Glaese, Johannes Welbl, Sumanth Dathathri, Saffron Huang, Jonathan Uesato, John Mellor…
Was es tut
Die Problemfelder, für die das Modell entwickelt wurde. Ein Modell kann mehrere davon tragen.
- Domain
- Language
- Aufgabe
- Language modeling, Question answering
- Ansatz
- Self-supervised learning
- Numerisches Format
- BF16
Größe
Wie groß das Modell ist und wie viele Daten damit trainiert wurden. Parameter sind die Zahl, die entscheidet, ob es auf einer bestimmten GPU-Karte passt.
- Parameter
- 280B
- Trainingsdaten
- 300,000,000,000 tokens
- Epochen
- 1
- Batch-Größe
- 6,000,000
Language modelling provides a step towards intelligent communication systems by harnessing large repositories of written human knowledge to better predict and understand the world. In this paper, we present an analysis of Transformer-based language model performance across a wide range of model scales -- from models with tens of millions of parameters up to a 280 billion parameter model called Gopher. These models are evaluated on 152 diverse tasks, achieving state-of-the-art performance across …
"We train all models for 300 billion tokens with a 2048 token context window, using the Adam (Kingma and Ba, 2014) optimiser." 1 token ~ 0.75 words
Table 1. "Furthermore, we increase Gopher’s batch size from three to six million tokens per batch during training"
Training-Compute
Die Berechnung, die durchgeführt wird, um das Modell zu trainieren, gemessen in Gleitpunktoperationen. Es ist ein Maß dafür, was der Trainingslauf gekostet hat, nicht dafür, wie schnell das fertige Modell Ihnen antwortet.
- Training-Compute
- 6.3 × 10²³ FLOP
- Wie es etabliert wurde
- Reported
Table A26 6.31E+08 Train PFLOPs
Der Trainingslauf
Was es physisch gekostet hat, um zu trainieren: welche Chips, wie viele, wie lange und was das aus der Wand gezogen hat.
- Trainingshardware
- Google TPU v3
- Verwendete Chips
- 4,096
- Chip-Stunden
- 3,768,320
- Wand-Uhrzeit
- 920 hours (38.3 days)
- Hardware-Auslastung
- MFU 37.8%
- Stromverbrauch
- 3.7 MW
- Rechenkosten
- $640,617
"We trained Gopher for 920 hours in November and December 2020 in Google’s Georgia datacentre. The PUE of the datacenter at this time was 1.08; the net tCO2e per MWh in October 2020 was 0.33. Using an estimate of 283W drawn per chip, this leads to a total of 380 net tCO2e"
Compute used to train model (table A26): 6.31e23 Maximum possble compute based on GPU-hours at 100% utilization: 920 * 4096 * 3600 * 1.23e14 = 1.669e24 Therefore, we can calculate utilization: MFU = 6.31e23 / 1.669e24 = 0.3780
Verfügbarkeit
Ob Sie das Modell beziehen und es auf Ihrer eigenen Hardware ausführen können, bestimmt, ob eine der Grafikkarten-Zahlen auf dieser Seite zutrifft.
- Gewichte
- Closed — provider access only
- Modellzugang
- Unreleased
- Training-Code
- Unreleased
Wie es klassifiziert ist
Labels, die das Quell-Datenset anwendet, wenn bemerkenswerte Modelle verfolgt werden, und wie zuversichtlich es in den Eintrag ist.
- Grenzmodell
- Yes
- Wahrscheinlich über 10²³ FLOP
- Yes
- Warum es verfolgt wird
- SOTA improvement
- Aufzeichnungsgenauigkeit
- Confident
- Zitationen
- 1,605
- Benchmark-Daten
- Gopher (280B)
"These models are evaluated on 152 diverse tasks, achieving state-of-the-art performance across the majority"
Quellen
Woher dieser Datensatz stammt und wann er zuletzt überprüft wurde.
- Referenz
- "Scaling Language Models: Methods, Analysis & Insights from Training Gopher"
- Zuletzt aktualisiert
- 25 May 2026
Was die Zahlen bedeuten
Hintergrund
Gopher (280B) wurde veröffentlicht von DeepMind, im Land aufgezeichnet als United Kingdom of Great Britain and Northern Ireland, während December 2021. Es stammt aus einer Organisation, die kategorisiert ist als industry.
Es funktioniert im Bereich von Language, und wird als die Aufgabe von aufgezeichnet language modeling, Question answering.
Dies ist ein geschlossenes Modell: die trainierten Werte blieben bei demjenigen, der sie erzeugt hat, und es gibt keine lokale Version zum Ausführen.
Was in den Aufbau geflossen ist
Das Training benötigte ein Rechenbudget von ungefähr 6.3 × 10²³ FLOP, auf Hardware erfasst als Google TPU v3. Diese Zahl misst die Kosten für die Produktion des MODELLS und hat keinen Einfluss darauf, wie schnell es antwortet.
Der Trainingssatz lief auf etwa 300,000,000,000 Text-Tokens
Das Einschlusskriterium: sOTA improvement.
Antworten
Gopher (280B) — Häufige Fragen
Gopher (280B)— Wann wurde es veröffentlicht?
Es wurde veröffentlicht in December 2021. Die Fähigkeit pro Parameter hat sich erheblich verbessert, sodass ein neueres Modell derselben Größe oft die bessere Nutzung derselben Hardware darstellt.
Gopher (280B)— Wofür wird es verwendet?
Es funktioniert im Bereich von Language, und wird als Bewältigung der Aufgabe von language modeling, Question answering. Modelle tragen häufig mehr als eines von jeder, und die Tags beschreiben den Zweck anstelle von Fähigkeitsgrenzen.
Gopher (280B)— Wie viel Rechenleistung wurde verwendet, um es zu trainieren?
Training verbrauchte etwa 6.3 × 10²³ FLOP, auf Hardware erfasst als Google TPU v3. Das misst, was die Produktion des Modells gekostet hat, und sagt nichts darüber aus, wie schnell es einmal trainiert antwortet — die Inferenzgeschwindigkeit kommt von der MEMORY-BANDWIDTH, nicht vom TRAINING-BUDGET.
Gopher (280B)— Welche GPU benötige ich, um es auszuführen?
Dieses ist ein geschlossenes Modell — seine Gewichte wurden nie veröffentlicht, sodass es zu keinem Preis heruntergeladen oder auf Ihrer eigenen Hardware ausgeführt werden kann. Es ist nur über seinen Anbieter erreichbar.
Gopher (280B)— Ist es Open-Source?
Nein. Seine Gewichte wurden nicht veröffentlicht, daher existiert es nur als ein Dienst, der von seinem Eigentümer kontrolliert wird.
Gopher (280B)— Wie viele Parameter hat es?
Es hat eine Parameteranzahl von 280B. Language modelling provides a step towards intelligent communication systems by harnessing large repositories of written human knowledge to better predict and understand the world. In this paper, we present an analysis of Transformer-based language model performance across a wide range of model scales -- from models with tens of millions of parameters up to a 280 billion parameter model called Gopher. These models are evaluated on 152 diverse tasks, achieving state-of-the-art performance across the majority. Gains from scale are largest in areas such as reading comprehension, fact-checking, and the identification of toxic language, but logical and mathematical reasoning see less benefit. We provide a holistic analysis of the training dataset and model's behaviour, covering the intersection of model scale with bias and toxicity. Finally we discuss the application of language models to AI safety and the mitigation of downstream harms. Diese Zahl ist die Gesamtsumme, und sie bestimmt, wie viel MEMORY das MODEL benötigt – ungefähr ein halbes Gigabyte pro Milliarde bei der Kompression, die die meisten Menschen verwenden.
Gopher (280B)— Wer hat es erstellt?
Es wurde veröffentlicht von DeepMind, basiert auf United Kingdom of Great Britain and Northern Ireland, eine als kategorisierte Organisation industry.
Die andere Richtung
Von der anderen Seite aus betrachten?
Diese Seite beginnt mit dem Modell. Wenn Sie bereits eine Karte besitzen und alles wissen möchten, was sie ausführen wird, Starte stattdessen von der Hardware.