Calculadora de FLOPs de Treinamento
Entradas
| Tipo de passagem | Passo de treinamento (6ND) |
|---|---|
| Parâmetros | 70 |
| Tokens de treinamento | 1.400 |
Calculadora de FLOPs de Treinamento
Estime as operações de ponto flutuante necessárias para treinar um transformer pela regra 6ND, a partir do número de parâmetros e dos tokens de treinamento, com o total em FLOPs e em petaFLOP/s-dias.
Entradas
Modelo e dados
Resultados
Insira um valor para ver os resultados.
Detalhes
FLOPs de treinamento
A computação necessária para treinar um modelo de linguagem grande é dominada por uma única grandeza: o número de operações de ponto flutuante realizadas ao longo de toda a execução. Para transformers densos, esse número é bem aproximado pela regra 6ND, segundo a qual o treinamento custa cerca de seis operações para cada parâmetro e cada token visto. Esta calculadora aplica a regra, recebendo o número de parâmetros e a contagem de tokens e devolvendo tanto a contagem bruta de operações quanto o equivalente em petaFLOP/s-dias.
A regra 6ND
A passagem direta de um transformer realiza cerca de duas operações de ponto flutuante por parâmetro por token — uma multiplicação e uma soma nas multiplicações de matrizes que dominam o trabalho. O treinamento acrescenta uma passagem reversa que propaga os gradientes tanto para as ativações quanto para os pesos, custando aproximadamente o dobro da passagem direta. Juntas, as passagens direta e reversa somam cerca de seis operações por parâmetro por token. Com parâmetros e tokens de treinamento, o total fica portanto próximo de . A estimativa captura as camadas lineares dominantes e omite contribuições menores de atenção, embeddings e normalização, que são desprezíveis para modelos grandes.
A fórmula
Com o fator de passagem (seis para um passo de treinamento, dois apenas para a passagem direta), o número de parâmetros em bilhões e a contagem de tokens em bilhões, a contagem total de operações e a computação em petaFLOP/s-dias são
CP=k⋅N⋅D⋅1018=8.64×1019Cem que são os FLOPs totais e é a computação em petaFLOP/s-dias. O fator restaura os bilhões de e para as contagens absolutas. Um petaFLOP/s-dia equivale a um petaFLOP/s sustentado por um dia, igual a operações, de modo que dividir por esse valor converte uma contagem bruta de FLOPs na unidade em que as grandes execuções costumam ser reportadas.
Exemplo resolvido
Considere um modelo de 70 bilhões de parâmetros treinado com 1.400 bilhões de tokens, uma razão de vinte tokens por parâmetro, em linha com a prática compute-ótima:
CP=6×70×1400×1018=5.88×1023 FLOPs=8.64×10195.88×1023≈6805,6 PFLOP/s-diasA execução exige cerca de operações, ou aproximadamente 6.806 petaFLOP/s-dias. Mudar o fator de passagem para dois reporta apenas o custo da passagem direta, um terço do total de treinamento.
Limites
A regra 6ND é uma contagem idealizada de aritmética, não uma previsão de tempo de relógio ou de custo. O hardware real sustenta apenas uma fração de sua vazão de pico, de modo que o tempo efetivo resulta de dividir essa computação pela taxa alcançada, e não pela anunciada — uma diferença capturada pela Calculadora de Utilização de FLOPs do Modelo. A estimativa também omite a recomputação de ativações, os passos do otimizador, as passagens de avaliação e quaisquer execuções que falhem e reiniciem, todas elas somando à computação gasta na prática. A questão complementar de quantos tokens um modelo de dado tamanho deve ver é tratada pela Calculadora de Tokens Ótimos de Chinchilla, e a conversão dessa computação em orçamento de aluguel pela Calculadora de Custo de GPU na Nuvem.
Perguntas frequentes (FAQ)
O que é a regra 6ND?
A regra 6ND estima que treinar um transformer denso custa cerca de seis operações de ponto flutuante para cada parâmetro e cada token de treinamento, em que N é o número de parâmetros e D é o número de tokens. O fator seis vem de aproximadamente duas operações por parâmetro na passagem direta e cerca de quatro na passagem reversa que calcula os gradientes.
É uma aproximação de primeira ordem introduzida nos trabalhos sobre leis de escala; captura as multiplicações de matrizes dominantes e omite termos menores, como atenção e embeddings.
Qual a relação entre os FLOPs totais e os petaFLOP/s-dias?
Um petaFLOP/s-dia é a quantidade de computação produzida ao sustentar um petaFLOP/s por um dia inteiro, o que equivale a 8,64 × 10¹⁹ operações de ponto flutuante (10¹⁵ operações por segundo vezes 86.400 segundos). Dividir uma contagem total de FLOPs por esse valor a converte em petaFLOP/s-dias, a unidade em que as grandes execuções de treinamento costumam ser reportadas, já que as contagens brutas de FLOPs atingem magnitudes pouco práticas.
O que essa estimativa inclui e exclui?
A estimativa conta as operações de ponto flutuante das camadas lineares dominantes nas passagens direta e reversa para o número de tokens de treinamento informado. Não leva em conta a utilização do hardware, de modo que o tempo de relógio e o custo de uma execução real são maiores do que a computação ideal sugere.
Também omite a recomputação de ativações, a sobrecarga do otimizador, a avaliação e as execuções que falham ou reiniciam, todas elas somando à computação gasta na prática.
Aviso legal
Isto usa a aproximação 6ND de primeira ordem para transformers densos e conta apenas a computação ideal. O tempo e o custo reais de treinamento dependem da utilização do hardware, bem abaixo do pico, e de sobrecargas que a fórmula omite. Trate o resultado como uma estimativa de planejamento, não como uma contabilidade exata.