Calcolatore del numero di token di un dataset
Dati di input
| Parole | 100 |
|---|---|
| Token per parola | 1,3 |
| Epoche | 1 |
Calcolatore del numero di token di un dataset
Stima quanti token contiene un corpus di testo a partire dal numero di parole e da un rapporto token per parola, poi applica un fattore di scala in base alle epoche di addestramento per ricavare i token totali che il modello vedrà.
Dati di input
Corpus
Risultati
Inserisci un valore per visualizzare i risultati.
Dettagli
Il numero di token di un dataset
Addestrare e pianificare il budget di un modello linguistico parte da una sola grandezza: quanti token contiene il dataset. I corpora, però, vengono di solito descritti in parole, documenti o gigabyte, non in token, mentre il modello legge soltanto token. Questo calcolatore colma quella distanza convertendo un numero di parole in una stima di token tramite un rapporto token per parola, e applicando poi un fattore di scala in base al numero di epoche per ottenere il totale che il modello elaborerà.
Token, non parole
Un token è l'unità atomica che un tokenizer produce dividendo il testo in frammenti sotto-lessicali. Le parole frequenti diventano spesso un singolo token, mentre quelle più rare o lunghe vengono suddivise in più token, perciò un brano contiene quasi sempre più token che parole. Poiché la corrispondenza è appresa dal tokenizer, il rapporto tra token e parole è una proprietà del tokenizer e del testo, non una costante universale. Trattare parole e token come intercambiabili sottostima il conteggio reale e, con esso, il calcolo richiesto da un addestramento.
Come funziona la stima
La dimensione del corpus entra in milioni di parole, . Moltiplicandola per il rapporto token per parola si ottengono i token di un singolo passaggio sui dati. Ripetere il corpus per epoche moltiplica il lavoro che il modello svolge, quindi i token effettivi di addestramento sono il totale di un passaggio moltiplicato per il numero di epoche. Una grandezza in miliardi viene ricavata dal totale in milioni, perché la dimensione dei set di addestramento è quasi sempre indicata in miliardi di token.
La formula
Con in milioni di parole, rapporto ed epoche, il totale di un passaggio (in milioni), la sua forma in miliardi e il totale di addestramento scalato per le epoche (in milioni) sono
TE=W⋅r=T⋅eLa grandezza in miliardi è semplicemente .
Esempio svolto
Si consideri un corpus da 100 milioni di parole tokenizzato a 1,3 token per parola e addestrato per tre epoche:
TE=100×1,3=130 milioni di token=130×3=390 milioni di tokenUn singolo passaggio sui dati corrisponde a circa 130 milioni di token, ovvero 0,13 miliardi. Addestrare per tre epoche significa che il modello esegue passaggi in avanti e all'indietro sull'equivalente di 390 milioni di token, anche se solo 130 milioni sono unici. Il totale unico descrive l'informazione disponibile; il totale scalato per le epoche descrive il lavoro e quindi il calcolo.
Scelta del rapporto
Per la prosa in inglese con un moderno tokenizer byte-pair, circa 1,3 token per parola è un valore predefinito ragionevole, e circa quattro caratteri per token è un'approssimazione collegata. Codice, matematica e scritture non latine tendono a frammentarsi in più token, aumentando il rapporto. L'approccio affidabile consiste nell'eseguire il tokenizer previsto su un campione rappresentativo e dividere il numero di token prodotto per il numero di parole di quel campione, usando poi qui il rapporto misurato. La conversione inversa, da un budget di token a una lunghezza leggibile, è gestita dal Calcolatore da token a parole.
Limiti
Il risultato è una stima. Il numero esatto di token dipende dallo specifico tokenizer, dalla formattazione e dagli spazi, e da come i documenti vengono uniti, aspetti che un singolo rapporto non cattura mai del tutto. Contare le epoche come token aggiuntivi è corretto per il calcolo e lo scaling, ma i token ripetuti non portano nuova informazione e offrono rendimenti decrescenti oltre pochi passaggi. Per verificare se un dataset è abbastanza grande per una data dimensione di modello, confronta il totale di un passaggio con il valore ottimale dal punto di vista del calcolo nel Calcolatore dei token ottimali secondo Chinchilla.
Domande frequenti (FAQ)
Che differenza c'è tra token e parole?
Un token è l'unità che il modello legge davvero, prodotta da un tokenizer che divide il testo in frammenti sotto-lessicali. Le parole comuni corrispondono spesso a un singolo token, mentre quelle più rare o lunghe vengono spezzate in più token, perciò il numero di token di un testo è di solito superiore al numero di parole.
Il rapporto tra i due dipende dal tokenizer e dalla lingua, ed è per questo che questa stima applica al numero di parole un fattore esplicito di token per parola anziché trattarli come equivalenti.
Quale rapporto token per parola conviene usare?
Per la prosa in inglese tokenizzata con un moderno tokenizer byte-pair o unigram, circa 1,3 token per parola è una regola pratica diffusa, e circa quattro caratteri per token è una stima collegata. Codice, matematica e lingue morfologicamente ricche o con scritture non latine producono in genere più token per parola.
Il valore più affidabile si ottiene eseguendo il tokenizer di riferimento su un campione rappresentativo del corpus reale e dividendo il numero di token risultante per il numero di parole.
Le epoche ripetute vanno contate come più token?
Per le stime di calcolo e di scaling sì: ogni epoca esegue un altro insieme completo di passaggi in avanti e all'indietro sui dati, quindi i token effettivi di addestramento sono il totale di un passaggio moltiplicato per il numero di epoche.
Per le questioni di unicità dei dati la distinzione conta, perché i token ripetuti non sono nuova informazione e offrono rendimenti decrescenti oltre pochi passaggi. Questo calcolatore riporta sia il totale unico di un singolo passaggio sia il totale di addestramento scalato per le epoche, così da avere entrambe le prospettive.
Avvertenze legali
I conteggi dei token sono stime basate su un rapporto medio di token per parola; il totale esatto dipende dallo specifico tokenizer e dal testo stesso. Esegui il tokenizer previsto su un campione per ottenere un valore preciso prima di impegnare il budget di calcolo.