Calculadora de Tamanho Compute-Ótimo de Modelo
Entradas
| Orçamento de computação | 6.000 |
|---|---|
| Tokens por parâmetro | 20 |
Calculadora de Tamanho Compute-Ótimo de Modelo
Dado um orçamento de computação de treinamento em petaFLOP/s-dias, encontre o número de parâmetros e a contagem de tokens compute-ótimos de Chinchilla invertendo a regra 6ND sob uma razão fixa de tokens por parâmetro.
Entradas
Orçamento de computação
Resultados
Insira um valor para ver os resultados.
Detalhes
Tamanho Compute-Ótimo de Modelo
Dada uma quantidade fixa de computação de treinamento, as leis de escala de Chinchilla respondem a que tamanho de modelo essa computação deve construir e com quantos tokens ele deve treinar. A alocação compute-ótima emparelha parâmetros e dados em passo, em vez de gastar todo o orçamento em tamanho. Esta calculadora recebe um orçamento de computação em petaFLOP/s-dias, mantém fixa a razão de tokens por parâmetro e inverte a regra 6ND para devolver o número ótimo de parâmetros e a contagem ótima de tokens.
Alocando um orçamento de computação
A computação de treinamento é bem aproximada pela regra 6ND: cerca de seis operações de ponto flutuante por parâmetro por token. O estudo de Chinchilla mostrou que, para um orçamento fixo, a perda é minimizada quando o tamanho do modelo e o tamanho do conjunto de dados crescem juntos, com cerca de vinte tokens de treinamento por parâmetro. Fixar essa razão transforma a equação de computação numa relação só no número de parâmetros, que pode ser resolvida para o tamanho de modelo que um dado orçamento sustenta.
A fórmula
Seja o orçamento em petaFLOP/s-dias e a razão de tokens por parâmetro. Convertendo o orçamento para FLOPs e substituindo na regra , obtém-se , de modo que o número de parâmetros e a contagem de tokens são
ND=10916rC⋅8.64×1019=r⋅Nem que é o número ótimo de parâmetros em bilhões e a contagem ótima de tokens em bilhões. O fator converte petaFLOP/s-dias em FLOPs, e dividir por expressa em bilhões. A raiz quadrada aparece porque a computação cresce com o quadrado do número de parâmetros uma vez que os tokens estão atrelados a ele.
Exemplo resolvido
Tome um orçamento de 6.000 petaFLOP/s-dias na razão central de vinte tokens por parâmetro:
ND=10916×206000×8.64×1019≈65.7 bilho˜es=20×65.7≈1314.5 bilho˜es=1.31 trilha˜oO orçamento é mais bem gasto num modelo de cerca de 65,7 bilhões de parâmetros treinado com aproximadamente 1,31 trilhão de tokens. Dobrar o orçamento elevaria o número ótimo de parâmetros em cerca da raiz quadrada de dois, não por um fator de dois, por causa da dependência de raiz quadrada.
Limites
Isto reflete a perda de treinamento compute-ótima para um orçamento de treinamento fixo, e nada mais. Não pesa o custo de servir o modelo, que muitas vezes torna um modelo menor treinado com mais tokens a melhor escolha prática, de modo que os modelos implantados ficam, com frequência, abaixo do número de parâmetros que isto devolve. A razão fixa é, ela mesma, uma estimativa que muda com o conjunto de dados e a arquitetura, e as execuções reais sustentam apenas uma fração da vazão de pico do hardware. O lado dos dados do mesmo compromisso é coberto pela Calculadora de Tokens Ótimos de Chinchilla, e a computação bruta de qualquer configuração escolhida pela Calculadora de FLOPs de Treinamento.
Perguntas frequentes (FAQ)
Como dividir um orçamento de computação fixo entre tamanho do modelo e dados?
As leis de escala de Chinchilla mostram que, para um orçamento de treinamento fixo, a perda é minimizada quando parâmetros e tokens de treinamento crescem juntos, em vez de gastar a maior parte do orçamento em parâmetros. Manter a razão de tokens por parâmetro perto de vinte e resolver a equação de computação 6ND para esse orçamento dá o tamanho do modelo e o tamanho do conjunto de dados que aproveitam melhor a computação disponível.
Orçamentos maiores sustentam modelos e conjuntos de dados proporcionalmente maiores.
Por que o tamanho do modelo cresce com a raiz quadrada da computação?
A computação de treinamento sob a regra 6ND é seis vezes os parâmetros vezes os tokens. Manter os tokens em uma razão fixa r por parâmetro faz os tokens iguais a r vezes N, de modo que a computação se torna seis vezes r vezes N ao quadrado.
Como a computação cresce com o quadrado do número de parâmetros, recuperar o número de parâmetros a partir de um orçamento de computação exige tirar uma raiz quadrada: N é igual à raiz quadrada da computação dividida por seis r. Os tokens então seguem como r vezes N.
O que é um petaFLOP/s-dia?
Um petaFLOP/s-dia é a quantidade de computação produzida ao sustentar um petaFLOP/s — 10¹⁵ operações de ponto flutuante por segundo — por um dia inteiro. Multiplicando pelos 86.400 segundos de um dia, obtém-se 8,64 × 10¹⁹ operações. É a unidade padrão para reportar e comparar os orçamentos de computação de grandes execuções de treinamento, já que as contagens brutas de operações atingem magnitudes incômodas.
Aviso legal
Isto inverte a regra 6ND de primeira ordem sob uma razão fixa de tokens por parâmetro e reflete apenas a perda de treinamento compute-ótima. Não considera o custo de inferência, que muitas vezes favorece modelos menores treinados por mais tempo, nem a utilização do hardware abaixo do pico. Trate o resultado como uma estimativa de planejamento.