Calculadora de Contagem de Tokens do Conjunto de Dados
Entradas
| Palavras | 100 |
|---|---|
| Tokens por palavra | 1,3 |
| Épocas | 1 |
Calculadora de Contagem de Tokens do Conjunto de Dados
Estime quantos tokens um corpus de texto contém a partir da contagem de palavras e de uma razão de tokens por palavra, depois multiplique pelas épocas de treinamento para achar o total de tokens que o modelo verá.
Entradas
Corpus
Resultados
Insira um valor para ver os resultados.
Detalhes
Contagem de tokens do conjunto de dados
Treinar e orçar um modelo de linguagem começa por uma única grandeza: quantos tokens o conjunto de dados contém. Os corpora, porém, costumam ser descritos em palavras, documentos ou gigabytes, não em tokens, e o modelo só lê tokens. Esta calculadora preenche essa lacuna convertendo uma contagem de palavras em uma contagem estimada de tokens com uma razão de tokens por palavra, depois multiplicando pelo número de épocas de treinamento para dar o total que um modelo processará.
Tokens, não palavras
Um token é a unidade atômica que um tokenizador produz ao dividir o texto em pedaços de subpalavra. Palavras frequentes muitas vezes viram um único token, enquanto palavras mais raras ou longas são divididas em vários, de modo que um trecho quase sempre contém mais tokens do que palavras. Como o mapeamento é aprendido pelo tokenizador, a razão entre tokens e palavras é uma propriedade do tokenizador e do texto, não uma constante universal. Tratar palavras e tokens como intercambiáveis subestima a contagem real e, com ela, a computação que uma execução exigirá.
Como a estimativa funciona
O tamanho do corpus entra em milhões de palavras, . Multiplicar pela razão de tokens por palavra dá os tokens em uma única passagem sobre os dados. Repetir o corpus por épocas multiplica o trabalho que o modelo realiza, de modo que os tokens efetivos de treinamento são o total de uma passagem vezes a contagem de épocas. Um valor em bilhões é derivado do total em milhões porque os tamanhos de conjuntos de treinamento são, na maioria das vezes, cotados em bilhões de tokens.
A fórmula
Com em milhões de palavras, razão e épocas, o total de uma passagem (milhões), sua forma em bilhões e o total de treinamento multiplicado pelas épocas (milhões) são
TE=W⋅r=T⋅eO valor em bilhões é simplesmente .
Exemplo resolvido
Tome um corpus de 100 milhões de palavras tokenizado a 1,3 token por palavra e treinado por três épocas:
TE=100×1.3=130 milho˜es de tokens=130×3=390 milho˜es de tokensUma passagem sobre os dados dá cerca de 130 milhões de tokens, ou 0,13 bilhão. Treinar por três épocas significa que o modelo realiza passagens direta e reversa sobre o equivalente a 390 milhões de tokens, ainda que apenas 130 milhões sejam únicos. O total único descreve a informação disponível; o total multiplicado pelas épocas descreve o trabalho e, portanto, a computação.
Escolhendo a razão
Para prosa em inglês com um tokenizador moderno de pares de bytes, cerca de 1,3 token por palavra é um padrão razoável, e cerca de quatro caracteres por token é uma aproximação relacionada. Código, matemática e escritas não latinas tendem a se fragmentar em mais tokens, elevando a razão. A abordagem confiável é rodar o tokenizador pretendido sobre uma amostra representativa e dividir sua saída de tokens pela contagem de palavras dessa amostra, depois usar a razão medida aqui. A conversão inversa, de um orçamento de tokens de volta a um comprimento legível, é tratada pela Calculadora de Tokens para Palavras.
Limites
O resultado é uma estimativa. A contagem exata de tokens depende do tokenizador específico, da formatação e dos espaços em branco e de como os documentos são unidos, nada disso capturado perfeitamente por uma única razão. Contar épocas como tokens adicionais está correto para computação e escala, mas tokens repetidos não carregam informação nova e oferecem retornos decrescentes após algumas passagens. Para verificar se um conjunto de dados é grande o suficiente para um dado tamanho de modelo, compare o total de uma passagem com o alvo compute-ótimo na Calculadora de Tokens Ótimos de Chinchilla.
Perguntas frequentes (FAQ)
Como os tokens diferem das palavras?
Um token é a unidade que o modelo de fato lê, produzida por um tokenizador que divide o texto em pedaços de subpalavra. Palavras comuns costumam corresponder a um único token, enquanto palavras mais raras ou longas são quebradas em vários, de modo que a contagem de tokens de um texto costuma ser maior que a de palavras.
A razão entre as duas depende do tokenizador e do idioma, razão pela qual esta estimativa multiplica uma contagem de palavras por um fator explícito de tokens por palavra em vez de supor que sejam iguais.
Que razão de tokens por palavra é razoável?
Para prosa em inglês tokenizada com um tokenizador moderno de pares de bytes ou unigrama, cerca de 1,3 token por palavra é uma referência prática comum, e cerca de quatro caracteres por token é uma estimativa relacionada. Código, matemática e idiomas morfologicamente ricos ou de escrita não latina costumam produzir mais tokens por palavra.
O valor mais confiável vem de rodar o tokenizador alvo sobre uma amostra representativa do corpus real e dividir a contagem de tokens resultante pela contagem de palavras.
As épocas repetidas devem ser contadas como mais tokens?
Para estimativas de computação e de escala, sim: cada época realiza outro conjunto completo de passagens direta e reversa sobre os dados, de modo que os tokens efetivos de treinamento são a contagem de uma passagem vezes o número de épocas.
Para questões de unicidade dos dados a distinção importa, porque tokens repetidos não são informação nova e oferecem retornos decrescentes após algumas passagens. Esta calculadora reporta tanto o total único de uma passagem quanto o total de treinamento multiplicado pelas épocas, de modo que ambas as visões estão disponíveis.
Aviso legal
As contagens de tokens são estimativas baseadas em uma razão média de tokens por palavra; o total exato depende do tokenizador específico e do próprio texto. Rode o tokenizador pretendido sobre uma amostra para obter um valor preciso antes de comprometer orçamentos de computação.