Calculadora de Tokens Ótimos de Chinchilla
Entradas
| Parâmetros | 70 |
|---|---|
| Tokens por parâmetro | 20 |
Calculadora de Tokens Ótimos de Chinchilla
Encontre o número compute-ótimo de tokens de treinamento para um modelo usando a regra de Chinchilla de cerca de vinte tokens por parâmetro, com a computação de treinamento resultante em FLOPs.
Entradas
Modelo
Resultados
Insira um valor para ver os resultados.
Detalhes
Tokens ótimos de Chinchilla
O resultado de escala de Chinchilla redefiniu a forma de dimensionar modelos de linguagem. Mostrou que, para um orçamento de computação fixo, a melhor precisão não vem de tornar o modelo o maior possível, mas de escalar parâmetros e tokens de treinamento em conjunto — emparelhando cada parâmetro com cerca de vinte tokens de dados de treinamento. Esta calculadora aplica essa razão, recebendo o número de parâmetros e devolvendo a contagem compute-ótima de tokens junto com a computação de treinamento que ela implica.
A razão compute-ótima
Antes de Chinchilla, a prática predominante gastava a maior parte do orçamento de computação em parâmetros e relativamente pouco em dados, produzindo modelos subtreinados em relação ao seu tamanho. O estudo da DeepMind de 2022 ajustou leis de escala em centenas de execuções e descobriu que a perda é minimizada, para um dado orçamento, quando o tamanho do modelo e o tamanho do conjunto de dados crescem em passo. O ponto de equilíbrio empírico situa o conjunto de dados ótimo em cerca de vinte tokens de treinamento por parâmetro. Um modelo com parâmetros deve, portanto, treinar com cerca de tokens.
A fórmula
Com o número de parâmetros em bilhões e uma razão de tokens por parâmetro, a contagem ótima de tokens e a computação de treinamento associada são
DC=N⋅r=6⋅N⋅D⋅1018em que é o número ótimo de tokens de treinamento em bilhões e é a computação de treinamento em operações de ponto flutuante. A computação segue a regra , que cobra cerca de seis operações por parâmetro por token, e o fator restaura os bilhões de e para as contagens absolutas.
Exemplo resolvido
Considere um modelo de 70 bilhões de parâmetros e a razão central de vinte tokens por parâmetro:
DC=70×20=1400 bilho˜es de tokens=1.4 trilha˜o=6×70×1400×1018=5.88×1023 FLOPsO conjunto de dados compute-ótimo é de cerca de 1,4 trilhão de tokens, e treinar com ele custa aproximadamente operações. Elevar a razão — digamos, para cem tokens por parâmetro — aumenta tanto a contagem de tokens quanto a computação em proporção direta.
Limites
A razão de vinte para um minimiza a perda de treinamento sob um orçamento de treinamento fixo, mas ignora deliberadamente o custo de servir o modelo concluído. Um modelo que responderá a muitas requisições é treinado, com frequência, em muito mais tokens do que o ótimo de Chinchilla, porque um modelo menor treinado por mais tempo é mais barato de operar para a mesma qualidade. A razão ótima exata também muda com o conjunto de dados, o tokenizador e a arquitetura, de modo que vinte é uma estimativa central, não uma constante. O problema complementar de dimensionar um modelo a um orçamento de computação fixo é tratado pela Calculadora de Tamanho Compute-Ótimo de Modelo, e a computação bruta de uma configuração escolhida pela Calculadora de FLOPs de Treinamento.
Perguntas frequentes (FAQ)
O que é o resultado de escala de Chinchilla?
O resultado de Chinchilla, publicado pela DeepMind em 2022, constatou que os grandes modelos anteriores estavam subtreinados: para um orçamento de computação fixo, a precisão melhora mais quando o tamanho do modelo e os tokens de treinamento crescem juntos, em vez de gastar o orçamento principalmente em parâmetros.
O estudo ajustou leis de escala em centenas de execuções de treinamento e concluiu que a alocação compute-ótima emparelha cada parâmetro com cerca de vinte tokens de treinamento, um forte contraste com os modelos anteriores, treinados em razões muito menores.
Por que cerca de vinte tokens por parâmetro?
A razão decorre das leis de escala ajustadas aos dados de treinamento. Sob um orçamento de computação fixo, a perda é minimizada quando o benefício marginal de acrescentar parâmetros se iguala ao de acrescentar tokens, e os expoentes empíricos do estudo de Chinchilla situam esse equilíbrio perto de vinte tokens por parâmetro.
O valor exato depende do conjunto de dados e da arquitetura, de modo que vinte é uma estimativa central arredondada, não uma constante precisa.
Vinte tokens por parâmetro ainda é o alvo correto?
Vinte é a razão compute-ótima para minimizar a perda de treinamento sob um orçamento de treinamento fixo, mas ignora o custo de inferência. Um modelo que atenderá muitas requisições costuma ser treinado com muito mais tokens do que o ótimo de Chinchilla, porque um modelo menor treinado por mais tempo é mais barato de operar, ainda que seu treinamento não tenha sido compute-ótimo.
Vários modelos amplamente usados são treinados em razões de cem ou mais por esse motivo, de modo que vinte é um piso, não um teto.
Aviso legal
A razão de vinte tokens por parâmetro é uma estimativa central das leis de escala de Chinchilla e varia com o conjunto de dados e a arquitetura. Ela otimiza apenas a computação de treinamento e não considera o custo de inferência, que muitas vezes justifica treinar modelos menores com muito mais tokens. Use o resultado como ponto de partida, não como regra fixa.