Calculadora de Aquecimento da Taxa de Aprendizado
Entradas
| Taxa de aprendizado de pico | 0,0003 |
|---|---|
| Taxa de aprendizado mínima | 3e-5 |
| Passos de aquecimento | 2.000 |
| Passos totais | 100.000 |
| Passo atual | 1.000 |
Calculadora de Aquecimento da Taxa de Aprendizado
Calcule a taxa de aprendizado em qualquer passo de treinamento para o cronograma padrão de transformers: aquecimento linear até um pico seguido de decaimento cosseno rumo a um piso, mais a fração de aquecimento.
Entradas
Cronograma
Resultados
Insira um valor para ver os resultados.
Detalhes
Aquecimento da Taxa de Aprendizado
A taxa de aprendizado é o hiperparâmetro mais decisivo no treinamento de redes neurais, e os transformers modernos raramente a mantêm constante. A receita padrão a eleva de zero a um pico ao longo dos primeiros passos, depois a decai por uma curva cosseno rumo a um pequeno piso pelo resto da execução. Esta calculadora devolve a taxa de aprendizado em qualquer passo escolhido sob esse cronograma, junto com a fração do treinamento gasta em aquecimento.
Por que a taxa muda ao longo do tempo
No início do treinamento os pesos são aleatórios e as estimativas correntes do otimizador para as estatísticas de gradiente são pouco confiáveis, de modo que atualizações grandes podem fazer a perda divergir. Um aquecimento curto, durante o qual a taxa sobe linearmente de zero, mantém pequenas as atualizações iniciais enquanto o otimizador se estabiliza. Uma vez terminado o aquecimento, uma taxa alta acelera o progresso, mas mantê-la alta até o fim deixa o modelo oscilando em torno de um mínimo em vez de se acomodar. Decair a taxa — aqui por uma curva cosseno — deixa o modelo dar passos grandes no início e passos progressivamente mais finos à medida que converge.
O cronograma
Duas fases governam a taxa. Durante o aquecimento, enquanto o passo atual é no máximo o comprimento do aquecimento , a taxa sobe linearmente ao pico . Após o aquecimento, ela segue um decaimento cosseno do pico rumo ao piso ao longo dos passos restantes até o total .
ηη=ηmaxws=ηmin+21(ηmax−ηmin)(1+cosS−wπ(s−w))(s≤w)(s>w)A fração de aquecimento é simplesmente . No ponto médio do decaimento o termo cosseno é zero, de modo que a taxa fica exatamente na metade entre o pico e o piso.
Exemplo resolvido
Tome um pico de 0,0003, um piso de 0,00003, 2.000 passos de aquecimento e 100.000 passos totais. No passo 1.000 — ainda dentro do aquecimento — e no passo 51.000 — o ponto médio do decaimento — as taxas são
η1000η51000=0.0003×20001000=0.00015=0.00003+21(0.0003−0.00003)(1+cos2π)=0.000165Na metade do aquecimento a taxa é metade do pico. No ponto médio do decaimento, onde o cosseno vale zero, ela fica exatamente entre o pico e o piso. O aquecimento aqui abrange 2.000 de 100.000 passos, ou 2% da execução.
Escolhendo os valores
A taxa de pico domina o cronograma e costuma ser encontrada empiricamente, muitas vezes com um teste de faixa que eleva a taxa até a perda parar de melhorar. Os picos publicados para grandes transformers costumam ficar entre cerca de 1e-4 e 6e-4, e o pico tende a crescer com o tamanho do lote, de modo que mudar o tamanho efetivo do lote em geral exige reajustá-lo. Um aquecimento de algumas centenas a alguns milhares de passos, muitas vezes uma pequena porcentagem da execução, é típico. O piso é frequentemente fixado em cerca de um décimo do pico, ou em zero quando se quer o decaimento completo.
Limites
Os frameworks diferem em detalhes que este modelo não captura: alguns medem o cronograma em tokens em vez de passos, alguns parametrizam o piso como uma razão do pico, e alguns acrescentam uma cauda final constante ou linear. A forma cosseno com aquecimento aqui é o padrão comum, mas os hiperparâmetros certos são específicos do problema e devem ser confirmados por experimento. A computação que uma dada contagem de passos representa é estimada pela Calculadora de Tempo e Custo de Treinamento, e a conta de hardware por trás dela pela Calculadora de Custo de GPU na Nuvem.
Perguntas frequentes (FAQ)
Por que aquecer a taxa de aprendizado em vez de começar no pico?
No início do treinamento o otimizador tem pouca informação confiável: os métodos adaptativos têm estimativas ruidosas das estatísticas de gradiente, e os pesos inicializados aleatoriamente produzem atualizações grandes e erráticas. Começar na taxa de pico nesse estado pode desestabilizar ou divergir a execução.
Elevar a taxa ao longo dos primeiros passos deixa o otimizador se acomodar enquanto as atualizações são pequenas, após o que a taxa de pico pode ser aplicada com segurança. O aquecimento é especialmente importante para tamanhos de lote grandes e transformers profundos, onde a instabilidade inicial é mais acentuada.
Que cronograma esta calculadora modela?
Ela modela o cronograma usado na maior parte do treinamento moderno de transformers: um aquecimento linear de zero ao pico ao longo dos passos de aquecimento, seguido de um decaimento cosseno do pico rumo ao mínimo ao longo dos passos restantes. A forma cosseno passa mais tempo perto da taxa alta no início do decaimento e desce suavemente ao piso no fim, o que empiricamente treina bem.
Existem outros cronogramas — constante, decaimento linear, raiz quadrada inversa e decaimento em degraus — mas o aquecimento linear com decaimento cosseno é o padrão comum que esta ferramenta reproduz.
Como a taxa de aprendizado de pico é escolhida?
A taxa de pico é o hiperparâmetro mais importante do cronograma e costuma ser encontrada empiricamente, muitas vezes com um teste de faixa curto que aumenta a taxa até a perda parar de melhorar e então recua.
Os valores publicados para grandes transformers costumam ficar entre cerca de 1e-4 e 6e-4 para os maiores modelos, com os modelos menores tolerando taxas um pouco mais altas. O pico em geral cresce com o tamanho do lote, de modo que uma mudança no tamanho efetivo do lote normalmente exige reajustá-lo.
Aviso legal
Isto reproduz o cronograma comum de aquecimento linear seguido de decaimento cosseno; os frameworks reais variam em detalhes como medir o decaimento em passos ou em tokens e como parametrizar o mínimo. Os hiperparâmetros ótimos são específicos do problema e devem ser confirmados empiricamente.