Epochen aus Rechenbudget Rechner
Eingaben
| Rechenbudget | 6.000 |
|---|---|
| Parameter | 70 |
| Datensatz-Tokens | 300 |
Epochen aus Rechenbudget Rechner
Ermittelt, wie viele Epochen ein Trainingsrechenbudget erlaubt: wandelt PFLOP/s-Tage mit der 6N-Regel in trainierbare Tokens um und teilt durch die Datensatzgröße in Tokens.
Eingaben
Budget
Ergebnisse
Geben Sie einen Wert ein, um die Ergebnisse zu sehen.
Epochen aus dem Rechenbudget
Ein festes Rechenbudget und ein fester Datensatz bestimmen gemeinsam, wie oft ein Modell seine Daten lesen kann. Die Planung eines Trainingslaufs läuft oft auf diese Frage hinaus: Wie viele Epochen sind bei so und so vielen PFLOP/s-Tagen Zuteilung, einem Modell bekannter Größe und einem Datensatz bekannter Token-Zahl tragbar? Dieser Rechner beantwortet sie, indem er das Budget mit dem Standard-Kostenmodell in trainierbare Tokens umwandelt und durch die Datensatzgröße teilt.
Rechenleistung, Tokens und Epochen
Trainingsrechenleistung wird üblicherweise in PFLOP/s-Tagen zugeteilt — ein Petaflop pro Sekunde über einen Tag gehalten. Die dominierenden Kosten eines Trainingsschritts lassen sich gut durch sechs Gleitkommaoperationen je Parameter und Token annähern: zwei für den Vorwärtsdurchlauf und rund vier für den Rückwärtsdurchlauf. Diese Regel wandelt ein Rechenbudget direkt in eine Token-Zahl um, denn das Budget in Operationen geteilt durch die Kosten je Token ist die Zahl der Tokens, auf denen das Budget trainieren kann. Die Division dieser trainierbaren Tokens durch die Datensatzgröße ergibt die Zahl der vollständigen Durchläufe, also der Epochen.
Die Formel
Sei das Budget in PFLOP/s-Tagen, die Parameter in Milliarden und der Datensatz in Milliarden Tokens. Ein PFLOP/s-Tag entspricht Operationen, und Milliarden Parameter sind beim Sechs-Operationen-Satz , sodass die trainierbaren Tokens (Milliarden) und die Epochen lauten
Be=6⋅N⋅1018C⋅8.64×1019=DBRechenbeispiel
Betrachtet sei ein Budget von 6.000 PFLOP/s-Tagen für ein Modell mit 70 Milliarden Parametern und einen Datensatz von 300 Milliarden Tokens:
Be=6⋅70⋅10186000⋅8.64×1019≈1234.3 Milliarden Tokens=3001234.3≈4.11 EpochenDas Budget trägt etwa 1,23 Billionen trainierbare Tokens, was rund vier vollständigen Durchläufen über den Datensatz von 300 Milliarden Tokens entspricht. Ein Ergebnis so weit über eins ist ein Signal, dass der Datensatz im Verhältnis zur verfügbaren Rechenleistung klein ist.
Das Ergebnis deuten
Eine Epochen-Zahl nahe eins bedeutet, dass das Budget auf einen einzelnen Durchlauf über die Daten abgestimmt ist — das Regime, das rechenoptimale Rezepte für große Modelle bevorzugen. Eine Zahl deutlich über eins bedeutet, dass genug Rechenleistung vorhanden ist, um die Daten mehrfach zu wiederholen; da frische Tokens informativer sind als wiederholte, spricht dies oft dafür, weitere einzigartige Daten zu sammeln, statt denselben Korpus durchzulaufen. Eine Zahl unter eins bedeutet, dass das Budget nicht einmal einen einzelnen Durchlauf trägt, was ein kleineres Modell, einen kleineren Datenausschnitt oder mehr Rechenleistung erfordert. Die abgestimmte Paarung von Modellgröße und Token-Zahl für ein Budget behandelt der Rechenoptimale Modellgröße Rechner.
Grenzen
Die Schätzung verwendet die Näherung von sechs Operationen je Parameter und Token und setzt voraus, dass das gesamte Budget für nützliches Training ausgegeben wird. Reale Läufe halten nur einen Bruchteil des Spitzendurchsatzes, verlieren Zeit durch Kommunikations- und Pipeline-Overhead und verbrauchen Rechenleistung für Evaluierung und Neustarts, sodass die erreichbare Epochen-Zahl unter dieser oberen Grenze liegt. Das rechenoptimale Token-Ziel für eine gegebene Modellgröße, an dem sich ein Datensatz als ausreichend beurteilen lässt, liefert der Chinchilla-optimale Tokens Rechner.
Häufig gestellte Fragen (FAQ)
Wie wird die Zahl der Epochen aus einem Rechenbudget abgeleitet?
Ein Rechenbudget in PFLOP/s-Tagen wird zunächst in reine Gleitkommaoperationen umgerechnet: Ein PFLOP/s-Tag sind 8,64 × 10^19 Operationen. Das Standard-Kostenmodell veranschlagt etwa sechs Operationen je Parameter und Token für einen vollständigen Trainingsschritt, sodass die Division des Budgets durch das Sechsfache der Parameterzahl die Tokens ergibt, auf denen es trainieren kann.
Die Division dieser trainierbaren Tokens durch die Größe des Datensatzes ergibt die Zahl der vollständigen Durchläufe — die Epochen —, die das Budget erlaubt.
Ist ein Training über mehr als eine Epoche ratsam?
Rechenoptimale Rezepte für große Modelle bevorzugen einen einzelnen Durchlauf über einen sehr großen, überwiegend einzigartigen Datensatz, weil frische Tokens informativer sind als wiederholte. Sind die Daten begrenzt, kann ihre Wiederholung über einige Epochen ein Modell dennoch verbessern, mit Erträgen, die abnehmen, je öfter dieselben Tokens gesehen werden.
Meldet der Rechner viele tragbare Epochen, deutet dies meist darauf hin, dass der Datensatz für das Budget klein ist und das Sammeln weiterer einzigartiger Daten die Rechenleistung wirksamer nutzen würde als das Wiederholen des Vorhandenen.
Was bedeutet eine Epochen-Zahl unter eins?
Ein Wert unter eins bedeutet, dass das Budget bei der gewählten Modellgröße keinen einzelnen vollständigen Durchlauf über den Datensatz tragen kann. Die praktischen Reaktionen sind, die Modellgröße zu verringern, da die Kosten mit der Parameterzahl skalieren, einen kleineren Teil der Daten zu verwenden oder das Rechenbudget zu erhöhen.
Die rechenoptimale Modellgröße für ein gegebenes Budget ist eine eigene Frage, die der zugehörige Modellgrößen-Rechner behandelt.
Haftungsausschluss
Dies verwendet die Standard-Näherung von 6N FLOPs je Token und lässt Overhead wie eine Auslastung unter dem Spitzenwert, Attention-Terme und Evaluierung außer Acht. Reale Läufe erreichen nur einen Bruchteil des Spitzendurchsatzes, sodass die Epochen-Zahl als obere Planungsgrenze zu verstehen ist.