Calculadora de aceleración por decodificación especulativa
Datos de entrada
| Tasa de aceptación | 70 % |
|---|---|
| Tokens de borrador por ciclo | 5 |
| Relación de coste del borrador | 15 % |
Calculadora de aceleración por decodificación especulativa
Estima la aceleración de la decodificación mediante muestreo especulativo: introduzca la tasa de aceptación del borrador, los tokens de borrador por ciclo y el coste relativo del borrador para obtener los tokens aceptados esperados y la aceleración en tiempo real.
Datos de entrada
Modelo borrador
Resultados
Introduce un valor para ver los resultados.
Detalles
Aceleración por decodificación especulativa
La decodificación especulativa acelera la generación de un modelo de lenguaje al permitir que un modelo borrador pequeño y económico adelante varios tokens, que después el modelo objetivo grande verifica de una sola vez. Cuando los aciertos son correctos, el objetivo produce varios tokens al precio de una única pasada directa; cuando son erróneos, recurre a la decodificación ordinaria. Esta calculadora estima la aceleración resultante a partir de tres cifras: con qué frecuencia se aceptan los tokens del borrador, cuántos se proponen en cada ciclo y cuán costoso es el modelo borrador en relación con el objetivo.
Cómo funciona
En un decodificador normal, el modelo objetivo se ejecuta una vez por token. La decodificación especulativa, en cambio, pide al modelo borrador que proponga tokens y luego ejecuta el objetivo una sola vez para comprobarlos en paralelo. El objetivo acepta cada token propuesto mientras coincida con lo que él mismo habría muestreado, se detiene en el primer desacuerdo y vuelve a muestrear esa posición desde su propia distribución. Como los tokens rechazados se corrigen desde el objetivo, la salida es estadísticamente idéntica a la de la decodificación simple: el método cambia cómputo adicional del borrador por menos pasadas costosas del objetivo, sin alterar lo que dice el modelo.
La fórmula
Si cada token se acepta de forma independiente con probabilidad , el número esperado de tokens producidos por pasada del objetivo es
τ=1−α1−αγ+1Esa sería la aceleración si el modelo borrador fuera gratuito. Cobrando a cada pasada del borrador una fracción de una pasada del objetivo, la aceleración en tiempo real frente a la decodificación ordinaria queda
S=(γc+1)(1−α)1−αγ+1El numerador premia la aceptación y las propuestas más largas; el denominador penaliza el trabajo de borrador que esas propuestas cuestan.
Ejemplo resuelto
Supóngase que el modelo borrador se acepta el 70 % de las veces, propone 5 tokens por ciclo y cada pasada del borrador cuesta el 15 % de una pasada del objetivo:
τS=1−0.71−0.76=0.30.8824≈2.94=(5×0.15+1)(0.3)0.8824=0.5250.8824≈1.68Cada pasada del objetivo rinde casi tres tokens de media, pero tras pagar cinco pasadas de borrador la aceleración real es de aproximadamente 1,7×. Elevar la aceptación al 90 % la llevaría bastante más allá de 2×, mientras que un modelo borrador más pesado —por ejemplo, el 40 % del coste del objetivo— recuperaría gran parte de la ganancia.
Elección de la configuración
Dominan dos palancas. La tasa de aceptación aumenta cuando el modelo borrador está estrechamente alineado con el objetivo, por lo que los borradores suelen ser modelos más pequeños de la misma familia o destilaciones del objetivo. La longitud del borrador tiene un punto óptimo: como la aceptación se compone, la probabilidad de que sobreviva toda una tirada cae geométricamente, de modo que más allá de un puñado de tokens el coste adicional del borrador supera a las raras aceptaciones largas. Recorrer aquí el número de tokens de borrador muestra dónde alcanza su máximo la aceleración para una tasa de aceptación dada. Para ver cómo la mayor velocidad por token repercute en el tiempo de respuesta de extremo a extremo, consulte la Calculadora de latencia de inferencia.
Preguntas frecuentes (FAQ)
¿Qué es la tasa de aceptación?
Después de que el modelo borrador propone una secuencia de tokens, el modelo objetivo los comprueba y acepta cada uno mientras coincida con lo que el objetivo habría muestreado. La tasa de aceptación es la probabilidad de esa coincidencia por token.
Aumenta cuando el modelo borrador está bien alineado con el objetivo —por ejemplo, una versión más pequeña de la misma familia o un modelo ajustado para imitarlo— y disminuye con texto difícil o fuera de distribución.
Es importante destacar que la decodificación especulativa es exacta: los tokens rechazados se vuelven a muestrear desde el objetivo, de modo que la distribución de salida es idéntica a la de la decodificación ordinaria.
¿Por qué el coste del modelo borrador reduce la aceleración?
Cada ciclo ejecuta el modelo borrador varias veces para proponer tokens y el modelo objetivo una vez para verificarlos. Si el modelo borrador fuera gratuito, la aceleración igualaría los tokens aceptados esperados por pasada del objetivo. En la práctica, cada pasada del borrador consume tiempo, por lo que el denominador suma los tokens de borrador multiplicados por su coste relativo.
Un modelo borrador demasiado grande erosiona su propio beneficio, razón por la cual los borradores eficaces son mucho más pequeños que el objetivo.
¿Cuántos tokens de borrador conviene proponer por ciclo?
Existe un punto óptimo. Proponer más tokens eleva el mejor de los casos, pero como la aceptación se compone, la probabilidad de que toda la tirada sobreviva cae geométricamente: una vez rechazado un token, toda propuesta posterior de ese ciclo se descarta.
Pasado un puñado de tokens, el coste adicional del borrador supera a las raras aceptaciones largas. El óptimo depende de la tasa de aceptación y del coste del borrador; probar algunos valores aquí muestra dónde alcanza su máximo la aceleración.
Aviso legal
Este es un modelo simplificado que supone una tasa de aceptación por token constante y un coste relativo de borrador fijo. La aceptación real varía con el texto y la temperatura de muestreo, y la verificación añade una sobrecarga no recogida aquí, por lo que las aceleraciones medidas difieren. Utilice la cifra para comparar configuraciones, no como una predicción exacta.
Recomendaciones
Calculadora de latencia de inferencia
Estima el tiempo de respuesta de extremo a extremo de una generación en streaming de un LLM a partir del tiempo hasta el primer token, el tiempo por token de salida y el número de tokens de salida.
Calculadora de rendimiento de inferencia
Estima el límite que impone el ancho de banda de memoria a la velocidad de decodificación de un LLM a partir del tamaño del modelo, la precisión de los pesos y el ancho de banda de memoria del acelerador: el techo (roofline) de tokens por segundo de un único flujo.