Calcolatore delle epoche dal budget di calcolo
Dati di input
| Budget di calcolo | 6.000 |
|---|---|
| Parametri | 70 |
| Token del dataset | 300 |
Calcolatore delle epoche dal budget di calcolo
Trova quante epoche può permettersi un budget di calcolo per l'addestramento: converti i PFLOP/s-giorni in token addestrabili con la regola 6N, poi dividi per la dimensione del dataset in token.
Dati di input
Budget
Risultati
Inserisci un valore per visualizzare i risultati.
Le epoche dal budget di calcolo
Un budget di calcolo fisso e un dataset fisso determinano insieme quante volte un modello può leggere i propri dati. La pianificazione di un addestramento si riduce spesso a questa domanda: dati tot PFLOP/s-giorni di allocazione, un modello di dimensione nota e un dataset con un conteggio di token noto, quante epoche sono realizzabili? Questo calcolatore risponde convertendo il budget in token addestrabili con il modello di costo standard e dividendo per la dimensione del dataset.
Calcolo, token ed epoche
Il calcolo per l'addestramento è comunemente allocato in PFLOP/s-giorni — un petaflop al secondo sostenuto per un giorno. Il costo dominante di un passo di addestramento è ben approssimato da sei operazioni in virgola mobile per parametro e per token: due per il passaggio in avanti e circa quattro per il passaggio all'indietro. Quella regola trasforma un budget di calcolo direttamente in un conteggio di token, perché il budget in operazioni diviso per il costo per token è il numero di token su cui il budget può addestrare. Dividere quei token addestrabili per la dimensione del dataset dà il numero di passaggi completi, ovvero le epoche.
La formula
Sia il budget in PFLOP/s-giorni, i parametri in miliardi e il dataset in miliardi di token. Un PFLOP/s-giorno corrisponde a operazioni, e miliardi di parametri valgono alla tariffa di sei operazioni, quindi i token addestrabili (miliardi) e le epoche sono
Be=6⋅N⋅1018C⋅8.64×1019=DBEsempio
Si consideri un budget di 6.000 PFLOP/s-giorni per un modello da 70 miliardi di parametri e un dataset da 300 miliardi di token:
Be=6⋅70⋅10186000⋅8.64×1019≈1234.3 miliardi di token=3001234.3≈4.11 epocheIl budget paga circa 1,23 bilioni di token addestrabili, ovvero all'incirca quattro passaggi completi sul dataset da 300 miliardi di token. Un risultato così al di sopra di uno segnala che il dataset è piccolo rispetto al calcolo disponibile.
Leggere il risultato
Un numero di epoche vicino a uno significa che il budget è commisurato a un singolo passaggio sui dati, il regime che le ricette ottimali rispetto al calcolo per i grandi modelli tendono a prediligere. Un valore ben superiore a uno significa che c'è calcolo a sufficienza per ripetere i dati più volte; poiché i token nuovi sono più informativi di quelli ripetuti, ciò induce spesso a raccogliere più dati unici anziché ripercorrere lo stesso corpus. Un valore inferiore a uno significa che il budget non può permettersi neppure un singolo passaggio, nel qual caso servono un modello più piccolo, un sottoinsieme più ridotto di dati o più calcolo. L'accoppiamento commisurato di dimensione del modello e conteggio di token per un budget è oggetto del Calcolatore della dimensione ottimale del modello rispetto al calcolo.
Limiti
La stima usa l'approssimazione di sei operazioni per parametro e per token e presuppone che l'intero budget sia speso in addestramento utile. Le esecuzioni reali sostengono solo una frazione del throughput di picco, perdono tempo per la comunicazione e l'overhead di pipeline, e spendono calcolo in valutazione e riavvii, perciò il numero di epoche raggiungibile è inferiore a questo limite superiore. L'obiettivo di token ottimale rispetto al calcolo per una data dimensione del modello, rispetto al quale si può giudicare adeguato un dataset, è dato dal Calcolatore dei token ottimali secondo Chinchilla.
Domande frequenti (FAQ)
Come si ricava il numero di epoche da un budget di calcolo?
Un budget di calcolo in PFLOP/s-giorni viene prima convertito in operazioni in virgola mobile grezze: un PFLOP/s-giorno corrisponde a 8,64 × 10^19 operazioni. Il modello di costo standard addebita circa sei operazioni per parametro e per token per un passo completo di addestramento, quindi dividere il budget per sei volte il numero di parametri dà i token su cui può addestrare.
Dividere quei token addestrabili per la dimensione del dataset dà il numero di passaggi completi — le epoche — che il budget può permettersi.
Conviene addestrare per più di un'epoca?
Le ricette ottimali rispetto al calcolo per i grandi modelli prediligono un singolo passaggio su un dataset molto ampio e perlopiù unico, perché i token nuovi sono più informativi di quelli ripetuti. Quando i dati sono limitati, ripeterli per alcune epoche può comunque migliorare un modello, con ritorni che diminuiscono man mano che gli stessi token vengono rivisti.
Se il calcolatore indica molte epoche realizzabili, di solito è il segnale che il dataset è piccolo rispetto al budget e che raccogliere più dati unici userebbe il calcolo in modo più efficace che ripetere quelli esistenti.
Cosa significa un numero di epoche inferiore a uno?
Un valore inferiore a uno significa che il budget non può pagare un singolo passaggio completo sul dataset alla dimensione del modello scelta. Le risposte pratiche sono ridurre la dimensione del modello, dato che il costo cresce con il numero di parametri, usare un sottoinsieme più piccolo dei dati, oppure aumentare il budget di calcolo.
La dimensione del modello ottimale rispetto al calcolo per un dato budget è una questione distinta, affrontata dal relativo calcolatore della dimensione del modello.
Avvertenze legali
Questo strumento usa l'approssimazione standard 6N FLOP per token e ignora gli overhead come l'utilizzo al di sotto del picco, i termini di attenzione e la valutazione. Le esecuzioni reali raggiungono una frazione del throughput di picco, perciò il numero di epoche va inteso come una stima di pianificazione che ne segna il limite superiore.