Calculateur d'accélération par décodage spéculatif
Données
| Taux d'acceptation | 70 % |
|---|---|
| Jetons brouillons par cycle | 5 |
| Ratio de coût du brouillon | 15 % |
Calculateur d'accélération par décodage spéculatif
Estime l'accélération du décodage par échantillonnage spéculatif : saisissez le taux d'acceptation du modèle brouillon, le nombre de jetons brouillons par cycle et le coût relatif du brouillon pour obtenir les jetons acceptés attendus et l'accélération réelle.
Données
Modèle brouillon
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Accélération par décodage spéculatif
Le décodage spéculatif accélère la génération d'un modèle de langage en laissant un petit modèle brouillon, peu coûteux, deviner plusieurs jetons à l'avance, que le grand modèle cible vérifie ensuite tous en même temps. Quand les suppositions sont justes, la cible produit plusieurs jetons au prix d'une seule passe avant ; quand elles sont fausses, elle revient au décodage ordinaire. Ce calculateur estime l'accélération qui en résulte à partir de trois nombres : la fréquence à laquelle les jetons brouillons sont acceptés, le nombre proposé à chaque cycle et le coût du modèle brouillon par rapport à la cible.
Comment cela fonctionne
Dans un décodeur normal, le modèle cible s'exécute une fois par jeton. Le décodage spéculatif demande plutôt au modèle brouillon de proposer jetons, puis exécute la cible une fois pour les vérifier en parallèle. La cible accepte chaque jeton proposé tant qu'il concorde avec ce qu'elle aurait elle-même échantillonné, s'arrête au premier désaccord et rééchantillonne cette position depuis sa propre distribution. Comme les jetons rejetés sont corrigés depuis la cible, la sortie est statistiquement identique à celle du décodage ordinaire — la méthode échange du calcul brouillon supplémentaire contre un moindre nombre de passes cibles coûteuses, sans changer ce que le modèle dit.
La formule
Si chaque jeton est accepté indépendamment avec une probabilité , le nombre attendu de jetons produits par passe cible est
τ=1−α1−αγ+1Ce serait l'accélération si le modèle brouillon était gratuit. En imputant à chaque passe du brouillon une fraction d'une passe cible, l'accélération réelle par rapport au décodage ordinaire devient
S=(γc+1)(1−α)1−αγ+1Le numérateur récompense l'acceptation et les propositions plus longues ; le dénominateur pénalise le travail brouillon que ces propositions coûtent.
Exemple chiffré
Supposons que le modèle brouillon soit accepté 70 % du temps, propose 5 jetons par cycle et que chaque passe du brouillon coûte 15 % d'une passe cible :
τS=1−0.71−0.76=0.30.8824≈2.94=(5×0.15+1)(0.3)0.8824=0.5250.8824≈1.68Chaque passe cible produit en moyenne près de trois jetons, mais après avoir payé cinq passes brouillonnes, l'accélération réalisée est d'environ 1,7×. Porter l'acceptation à 90 % la ferait largement dépasser 2×, tandis qu'un modèle brouillon plus lourd — disons 40 % du coût de la cible — en reprendrait une bonne partie.
Choisir la configuration
Deux leviers dominent. Le taux d'acceptation augmente quand le modèle brouillon est étroitement aligné sur la cible : les brouillons sont donc généralement des modèles plus petits de la même famille ou des distillations de la cible. La longueur du brouillon a un optimum : comme l'acceptation se cumule, la probabilité qu'une série entière survive décroît géométriquement, de sorte qu'au-delà de quelques jetons, le surcoût du brouillon l'emporte sur les rares longues acceptations. Balayer le nombre de jetons brouillons ici montre où l'accélération culmine pour un taux d'acceptation donné. Pour voir comment l'amélioration de la vitesse par jeton se répercute sur le temps de réponse de bout en bout, voir le Calculateur de latence d'inférence.
Questions fréquentes (FAQ)
Qu'est-ce que le taux d'acceptation ?
Après que le modèle brouillon a proposé une suite de jetons, le modèle cible les vérifie et accepte chacun tant qu'il correspond à ce que la cible aurait échantillonné. Le taux d'acceptation est la probabilité par jeton de cette correspondance.
Il augmente quand le modèle brouillon est bien aligné sur la cible — par exemple une version plus petite de la même famille ou un modèle affiné pour l'imiter — et baisse sur des textes difficiles ou hors distribution.
Point crucial : le décodage spéculatif est exact, car les jetons rejetés sont rééchantillonnés depuis la cible, de sorte que la distribution de sortie est identique à celle du décodage ordinaire.
Pourquoi le coût du modèle brouillon réduit-il l'accélération ?
Chaque cycle exécute le modèle brouillon plusieurs fois pour proposer des jetons et le modèle cible une fois pour les vérifier. Si le modèle brouillon était gratuit, l'accélération serait égale au nombre attendu de jetons acceptés par passe cible. En réalité, chaque passe du brouillon prend du temps : le dénominateur ajoute donc les jetons brouillons multipliés par leur coût relatif.
Un modèle brouillon trop volumineux érode son propre bénéfice, ce qui explique pourquoi les brouillons efficaces sont bien plus petits que la cible.
Combien de jetons brouillons proposer par cycle ?
Il existe un optimum. Proposer plus de jetons relève le meilleur des cas, mais comme l'acceptation se cumule, la probabilité que toute la série survive décroît géométriquement — dès qu'un jeton est rejeté, toutes les propositions ultérieures de ce cycle sont écartées.
Au-delà de quelques jetons, le surcoût du brouillon l'emporte sur les rares longues acceptations. L'optimum dépend du taux d'acceptation et du coût du brouillon ; essayer quelques valeurs ici montre où l'accélération culmine.
Mentions légales
Il s'agit d'un modèle simplifié qui suppose un taux d'acceptation par jeton constant et un coût relatif de brouillon fixe. L'acceptation réelle varie selon le texte et la température d'échantillonnage, et la vérification ajoute un surcoût non pris en compte ici, de sorte que les accélérations mesurées diffèrent. Utilisez ce chiffre pour comparer des configurations plutôt que comme une prédiction exacte.
Recommandations
Calculateur de latence d'inférence
Estime le temps de réponse de bout en bout d'une complétion LLM en streaming à partir du délai jusqu'au premier jeton, du temps par jeton de sortie et du nombre de jetons générés.
Calculateur de débit d'inférence
Estime la limite de vitesse de décodage d'un LLM imposée par la bande passante mémoire, à partir de la taille du modèle, de la précision des poids et de la bande passante mémoire de l'accélérateur — le plafond en jetons par seconde pour un flux unique.