Calculadora de Tempo e Custo de Treinamento
Entradas
| FLOPs totais de treinamento | 5,88e23 |
|---|---|
| Utilização de FLOPs do modelo | 40 % |
| Número de GPUs | 1.024 |
| Vazão de pico por GPU | 989 |
| Preço por hora da GPU | 2,5 $ |
Calculadora de Tempo e Custo de Treinamento
Estime quanto tempo dura uma execução de treinamento de LLM e quanto ela custa, a partir dos FLOPs totais de treinamento, do número de GPUs, do pico de TFLOP/s por GPU, da utilização de FLOPs do modelo e do preço por hora da GPU.
Entradas
Carga de trabalho
Cluster
Resultados
Insira um valor para ver os resultados.
Tempo e Custo de Treinamento
Treinar um modelo de linguagem grande é uma quantidade fixa de aritmética distribuída por um cluster de aceleradores, de modo que sua duração e sua conta são ambas previsíveis assim que o trabalho e o hardware são conhecidos. Esta calculadora estima o tempo de relógio e o custo em horas de GPU de uma execução a partir dos FLOPs totais de treinamento, do número de GPUs, da vazão de pico de cada GPU, da utilização de FLOPs do modelo e do preço de aluguel por hora.
O que a estimativa cobre
O trabalho total de ponto flutuante de uma execução de treinamento é bem aproximado por uma única grandeza, muitas vezes escrita como seis vezes o número de parâmetros vezes o número de tokens de treinamento. Uma vez fixado esse total, a única coisa que altera o cronograma é a velocidade com que o cluster consegue processá-lo. A taxa sustentada de um cluster é a soma das taxas de pico de seus aceleradores reduzida pela fração que de fato usam, a utilização de FLOPs do modelo. Dividir o trabalho por essa taxa dá o tempo, e multiplicar o tempo pelo número de GPUs e pelo preço por hora dá o custo.
A fórmula
Com trabalho total em FLOPs, aceleradores classificados em TFLOP/s cada, uma utilização e um preço por hora por GPU, o tempo de execução e o custo total são
tT=n⋅P⋅1012⋅UC=3600t⋅n⋅cO fator converte TFLOP/s em FLOP/s, de modo que é expresso em segundos; dividir por 3600 o transforma em horas de GPU antes da precificação. Dobrar o número de GPUs reduz o tempo pela metade, mas mantém inalterado o custo em horas de GPU, pois o mesmo trabalho total é simplesmente concluído mais cedo.
Exemplo resolvido
Tome uma execução de FLOPs em 1.024 aceleradores classificados em 989 TFLOP/s cada, sustentando 40% de utilização, alugados a R$ 2,50 por GPU por hora:
tT=1024×989×1012×0.45.88×1023≈1.45×106 s≈16.8 dias=36001.45×106×1024×2.50≈1032000A execução leva cerca de dezessete dias e custa pouco mais de um milhão em aluguel de GPU. Elevar a utilização de 40% para 50% cortaria tanto o tempo quanto o custo em um quinto, razão pela qual extrair mais do mesmo hardware é a otimização mais barata disponível.
Limites
A estimativa supõe que a execução é limitada por computação e que o valor de utilização já é uma média sobre todo o trabalho. Exclui gravações de checkpoint, paradas no carregamento de dados, reinícios após falhas de hardware, passagens de validação e o tempo ocioso de uma reserva mantida sem computar. Rede, armazenamento e a diferença entre preços spot e reservados também movem o total real. Trate o resultado como uma referência de planejamento e adicione uma margem para sobrecarga. O trabalho total que alimenta esse cálculo é derivado na Calculadora de FLOPs de Treinamento, e o lado puro de aluguel da conta na Calculadora de Custo de GPU na Nuvem.
Perguntas frequentes (FAQ)
Como o tempo de treinamento é estimado?
O trabalho total de ponto flutuante da execução é dividido pela taxa que o cluster consegue sustentar. Essa taxa é o número de GPUs vezes os TFLOP/s de pico de cada GPU vezes a utilização de FLOPs do modelo, convertida em operações por segundo. Dividir as operações totais por essa taxa sustentada dá os segundos de relógio, que a calculadora reporta em dias, horas ou minutos.
A estimativa supõe que a execução é limitada por computação e que o valor de utilização já capta a eficiência média ao longo de todo o trabalho.
Que valor de utilização deve ser usado?
A utilização de FLOPs do modelo é a parcela da vazão teórica de pico que uma execução realmente alcança. No treinamento de modelos grandes em sistemas bem ajustados, costuma ficar entre 35% e 55%, com 40% sendo um padrão razoável. Modelos menores, sequências curtas, comunicação pesada ou kernels não otimizados a reduzem.
Como o tempo cresce na razão inversa da utilização, reduzi-la pela metade dobra o cronograma projetado, de modo que um valor medido em uma execução curta de perfilamento dá uma estimativa muito melhor do que um palpite.
Por que a conta real pode diferir dessa estimativa?
A estimativa conta apenas a computação em regime permanente na utilização escolhida. As execuções reais somam gravações de checkpoint, paradas no carregamento de dados, reinícios após falhas, passagens de validação e o tempo ocioso enquanto uma reserva é mantida sem computar.
Preços spot ou reservados, cobranças de rede e armazenamento e uma utilização que oscila ao longo da execução também movem o total. Trate o valor como uma referência de planejamento e adicione uma margem para sobrecarga, em vez de lê-lo como uma fatura exata.
Aviso legal
Esta estimativa supõe uma execução limitada por computação a uma utilização de FLOPs do modelo constante e exclui checkpoints, paradas no carregamento de dados, reinícios, rede e armazenamento. O tempo e o custo reais variam com o hardware, a pilha de software e o modelo de preços; trate o resultado como uma referência de planejamento.