Calculadora de Épocas a partir do Orçamento de Computação
Entradas
| Orçamento de computação | 6.000 |
|---|---|
| Parâmetros | 70 |
| Tokens do conjunto de dados | 300 |
Calculadora de Épocas a partir do Orçamento de Computação
Descubra quantas épocas um orçamento de computação de treinamento permite: converta PFLOP/s-dias em tokens treináveis com a regra 6N e divida pelo tamanho do conjunto de dados em tokens.
Entradas
Orçamento
Resultados
Insira um valor para ver os resultados.
Épocas a partir do orçamento de computação
Um orçamento de computação fixo e um conjunto de dados fixo, juntos, determinam quantas vezes um modelo consegue ler seus dados. Planejar uma execução de treinamento muitas vezes se resume a essa questão: dada uma alocação de tantos PFLOP/s-dias, um modelo de tamanho conhecido e um conjunto de dados de contagem de tokens conhecida, quantas épocas são viáveis? Esta calculadora a responde convertendo o orçamento em tokens treináveis com o modelo de custo padrão e dividindo pelo tamanho do conjunto de dados.
Computação, tokens e épocas
A computação de treinamento costuma ser alocada em PFLOP/s-dias — um petaflop por segundo sustentado por um dia. O custo dominante de um passo de treinamento é bem aproximado por seis operações de ponto flutuante por parâmetro por token: duas para a passagem direta e cerca de quatro para a passagem reversa. Essa regra transforma um orçamento de computação diretamente em uma contagem de tokens, porque o orçamento em operações dividido pelo custo por token é o número de tokens com que o orçamento consegue treinar. Dividir esses tokens treináveis pelo tamanho do conjunto de dados dá o número de passagens completas, ou épocas.
A fórmula
Seja o orçamento em PFLOP/s-dias, os parâmetros em bilhões e o conjunto de dados em bilhões de tokens. Um PFLOP/s-dia equivale a operações, e bilhões de parâmetros dão na taxa de seis operações, de modo que os tokens treináveis (bilhões) e as épocas são
Be=6⋅N⋅1018C⋅8.64×1019=DBExemplo resolvido
Tome um orçamento de 6.000 PFLOP/s-dias para um modelo de 70 bilhões de parâmetros e um conjunto de dados de 300 bilhões de tokens:
Be=6⋅70⋅10186000⋅8.64×1019≈1234.3 bilho˜es de tokens=3001234.3≈4.11 eˊpocasO orçamento paga por cerca de 1,23 trilhão de tokens treináveis, o que dá aproximadamente quatro passagens completas sobre o conjunto de dados de 300 bilhões de tokens. Um resultado tão acima de um é um sinal de que o conjunto de dados é pequeno em relação à computação disponível.
Lendo o resultado
Uma contagem de épocas perto de um significa que o orçamento está ajustado a uma única passagem sobre os dados, que é o regime que as receitas compute-ótimas para modelos grandes tendem a favorecer. Uma contagem bem acima de um significa que há computação suficiente para repetir os dados várias vezes; como tokens novos são mais informativos do que repetidos, isso muitas vezes argumenta por reunir mais dados únicos em vez de percorrer o mesmo corpus. Uma contagem abaixo de um significa que o orçamento não paga sequer uma única passagem, caso em que é preciso um modelo menor, um subconjunto menor de dados ou mais computação. O emparelhamento ajustado de tamanho de modelo e contagem de tokens para um orçamento é o tema da Calculadora de Tamanho Compute-Ótimo de Modelo.
Limites
A estimativa usa a aproximação de seis operações por parâmetro por token e supõe que todo o orçamento é gasto em treinamento útil. As execuções reais sustentam apenas uma fração da vazão de pico, perdem tempo com comunicação e sobrecarga de pipeline e gastam computação em avaliação e reinícios, de modo que a contagem de épocas alcançável é menor do que esse limite superior. O alvo compute-ótimo de tokens para um dado tamanho de modelo, contra o qual um conjunto de dados pode ser julgado adequado, é dado pela Calculadora de Tokens Ótimos de Chinchilla.
Perguntas frequentes (FAQ)
Como o número de épocas é derivado de um orçamento de computação?
Um orçamento de computação em PFLOP/s-dias é primeiro convertido em operações brutas de ponto flutuante: um PFLOP/s-dia equivale a 8,64 × 10^19 operações. O modelo de custo padrão cobra cerca de seis operações por parâmetro por token em um passo completo de treinamento, de modo que dividir o orçamento por seis vezes o número de parâmetros dá os tokens com que ele consegue treinar.
Dividir esses tokens treináveis pelo tamanho do conjunto de dados dá o número de passagens completas — as épocas — que o orçamento permite.
É recomendável treinar por mais de uma época?
As receitas compute-ótimas para modelos grandes favorecem uma única passagem sobre um conjunto de dados muito grande e majoritariamente único, porque tokens novos são mais informativos do que repetidos. Quando os dados são limitados, repeti-los por algumas épocas ainda pode melhorar um modelo, com retornos que diminuem à medida que os mesmos tokens são vistos de novo.
Se a calculadora reportar muitas épocas viáveis, isso geralmente indica que o conjunto de dados é pequeno para o orçamento e que reunir mais dados únicos usaria a computação de forma mais eficaz do que repetir o que já existe.
O que significa uma contagem de épocas abaixo de um?
Um valor abaixo de um significa que o orçamento não consegue pagar uma única passagem completa sobre o conjunto de dados no tamanho de modelo escolhido. As respostas práticas são reduzir o tamanho do modelo, já que o custo cresce com o número de parâmetros, usar um subconjunto menor dos dados ou aumentar o orçamento de computação.
O tamanho compute-ótimo de modelo para um dado orçamento é uma questão à parte, tratada pela calculadora de tamanho de modelo relacionada.
Aviso legal
Isto usa a aproximação padrão de 6N FLOPs por token e ignora sobrecargas como utilização abaixo do pico, termos de atenção e avaliação. As execuções reais alcançam uma fração da vazão de pico, de modo que a contagem de épocas deve ser tratada como um limite superior de planejamento.