Calculadora de Aceleração da Decodificação Especulativa
Entradas
| Taxa de aceitação | 70 % |
|---|---|
| Tokens de rascunho por ciclo | 5 |
| Razão de custo do rascunho | 15 % |
Calculadora de Aceleração da Decodificação Especulativa
Estime a aceleração da decodificação a partir da amostragem especulativa: informe a taxa de aceitação do rascunho, os tokens de rascunho por ciclo e o custo relativo do rascunho para obter os tokens aceitos esperados e a aceleração em tempo de relógio.
Entradas
Modelo de Rascunho
Resultados
Insira um valor para ver os resultados.
Detalhes
Aceleração da decodificação especulativa
A decodificação especulativa acelera a geração de modelos de linguagem ao permitir que um modelo de rascunho pequeno e barato adivinhe vários tokens à frente, que o grande modelo alvo então verifica de uma só vez. Quando as adivinhações estão corretas, o alvo produz vários tokens pelo preço de uma única passagem direta; quando estão erradas, ele recorre à decodificação comum. Esta calculadora estima a aceleração resultante a partir de três números: com que frequência os tokens de rascunho são aceitos, quantos são propostos por ciclo e quão caro é o modelo de rascunho em relação ao alvo.
Como funciona
Em um decodificador normal, o modelo alvo executa uma vez por token. A decodificação especulativa, em vez disso, pede ao modelo de rascunho que proponha tokens e então executa o alvo uma vez para verificá-los em paralelo. O alvo aceita cada token proposto desde que concorde com o que ele próprio teria amostrado, para na primeira divergência e reamostra aquela posição a partir de sua própria distribuição. Como os tokens rejeitados são corrigidos pelo alvo, a saída é estatisticamente idêntica à da decodificação comum — o método troca computação extra de rascunho por menos passagens caras do alvo sem alterar o que o modelo diz.
A fórmula
Se cada token é aceito independentemente com probabilidade , o número esperado de tokens produzidos por passagem do alvo é
τ=1−α1−αγ+1Essa seria a aceleração se o modelo de rascunho fosse gratuito. Cobrando de cada passagem de rascunho uma fração de uma passagem do alvo, a aceleração em tempo de relógio sobre a decodificação comum torna-se
S=(γc+1)(1−α)1−αγ+1O numerador recompensa a aceitação e propostas mais longas; o denominador penaliza o trabalho de rascunho que essas propostas custam.
Exemplo resolvido
Suponha que o modelo de rascunho seja aceito 70% das vezes, proponha 5 tokens por ciclo e que cada passagem de rascunho custe 15% de uma passagem do alvo:
τS=1−0.71−0.76=0.30.8824≈2.94=(5×0.15+1)(0.3)0.8824=0.5250.8824≈1.68Cada passagem do alvo rende quase três tokens em média, mas, depois de pagar por cinco passagens de rascunho, a aceleração realizada é de cerca de 1,7×. Elevar a aceitação para 90% a levaria bem além de 2×, enquanto um modelo de rascunho mais pesado — digamos, 40% do custo do alvo — recuperaria boa parte do ganho.
Escolhendo a configuração
Duas alavancas dominam. A taxa de aceitação sobe quando o modelo de rascunho está estreitamente alinhado com o alvo, então os rascunhos costumam ser modelos menores da mesma família ou destilações do alvo. O comprimento do rascunho tem um ponto ideal: como a aceitação se acumula, a probabilidade de toda a sequência sobreviver cai geometricamente, de modo que, além de um punhado de tokens, o custo extra de rascunho supera as raras aceitações longas. Varrer a contagem de tokens de rascunho aqui mostra onde a aceleração atinge o pico para uma dada taxa de aceitação. Para ver como a velocidade aprimorada por token alimenta o tempo de resposta de ponta a ponta, veja a Calculadora de Latência de Inferência.
Perguntas frequentes (FAQ)
O que é a taxa de aceitação?
Depois que o modelo de rascunho propõe uma sequência de tokens, o modelo alvo os verifica e aceita cada um desde que coincida com o que o alvo teria amostrado. A taxa de aceitação é a probabilidade por token dessa coincidência.
Ela sobe quando o modelo de rascunho está bem alinhado com o alvo — por exemplo, uma versão menor da mesma família ou um modelo ajustado para imitá-lo — e cai em textos difíceis ou fora da distribuição.
De forma crucial, a decodificação especulativa é exata: os tokens rejeitados são reamostrados a partir do alvo, de modo que a distribuição de saída é idêntica à da decodificação comum.
Por que o custo do modelo de rascunho reduz a aceleração?
Cada ciclo executa o modelo de rascunho várias vezes para propor tokens e o modelo alvo uma vez para verificá-los. Se o modelo de rascunho fosse gratuito, a aceleração seria igual aos tokens esperados aceitos por passagem do alvo. Na prática, cada passagem do rascunho leva tempo, então o denominador soma os tokens de rascunho multiplicados por seu custo relativo.
Um modelo de rascunho grande demais corrói o próprio benefício, e é por isso que rascunhos eficazes são bem menores que o alvo.
Quantos tokens de rascunho devem ser propostos por ciclo?
Existe um ponto ideal. Propor mais tokens eleva o melhor caso, mas, como a aceitação se acumula, a chance de toda a sequência sobreviver cai geometricamente — uma vez que um token é rejeitado, toda proposta posterior daquele ciclo é descartada.
Passado um punhado de tokens, o custo adicional de rascunho supera as raras aceitações longas. O ótimo depende da taxa de aceitação e do custo do rascunho; testar alguns valores aqui mostra onde a aceleração atinge o pico.
Aviso legal
Este é um modelo simplificado que assume uma taxa de aceitação por token constante e um custo relativo de rascunho fixo. A aceitação real varia com o texto e com a temperatura de amostragem, e a verificação adiciona uma sobrecarga não capturada aqui, de modo que as acelerações medidas diferem. Use a cifra para comparar configurações, e não como uma previsão exata.
Próximas sugestões
Calculadora de Latência de Inferência
Estime o tempo de resposta de ponta a ponta de uma conclusão de LLM em streaming a partir do tempo até o primeiro token, do tempo por token de saída e do número de tokens de saída.
Calculadora de Vazão de Inferência
Estime o limite imposto pela largura de banda de memória sobre a velocidade de decodificação de um LLM a partir do tamanho do modelo, da precisão dos pesos e da largura de banda de memória do acelerador — o teto de tokens por segundo para um único fluxo.