Temps et coût d'entraînement
Données
| Nombre total de FLOP d'entraînement | 5,88e23 |
|---|---|
| Taux d'utilisation des FLOP du modèle | 40 % |
| Nombre de GPU | 1 024 |
| Débit crête par GPU | 989 |
| Prix horaire du GPU | 2,5 $ |
Temps et coût d'entraînement
Estimez la durée d'un entraînement de modèle de langage et son coût à partir du nombre total de FLOP, du nombre de GPU, du débit crête par GPU en TFLOP/s, du taux d'utilisation et du prix horaire du GPU.
Données
Charge de travail
Grappe de calcul
Résultats
Saisissez une valeur pour afficher les résultats.
Temps et coût d'entraînement
Entraîner un grand modèle de langage représente une quantité fixe d'arithmétique répartie sur une grappe d'accélérateurs : sa durée comme sa facture sont donc prévisibles une fois connus le travail et le matériel. Ce calcul estime la durée réelle et le coût en heures-GPU d'un entraînement à partir du total des FLOP, du nombre de GPU, du débit crête de chaque GPU, du taux d'utilisation des FLOP du modèle et du prix horaire de location.
Ce que couvre l'estimation
Le travail total en virgule flottante d'un entraînement est bien approché par une seule grandeur, souvent écrite comme six fois le nombre de paramètres multiplié par le nombre de jetons d'entraînement. Une fois ce total fixé, seule la vitesse à laquelle la grappe l'accomplit modifie le calendrier. Le débit soutenu d'une grappe est la somme des débits crêtes de ses accélérateurs, ramenée à la fraction qu'ils utilisent réellement, soit le taux d'utilisation des FLOP du modèle. Diviser le travail par ce débit donne la durée, et multiplier la durée par le nombre de GPU et le prix horaire donne le coût.
La formule
Avec un travail total en FLOP, accélérateurs cotés chacun à TFLOP/s, un taux d'utilisation et un prix horaire par GPU, la durée et le coût total valent
tT=n⋅P⋅1012⋅UC=3600t⋅n⋅cLe facteur convertit les TFLOP/s en FLOP/s, de sorte que s'exprime en secondes ; la division par 3600 la convertit en heures-GPU avant tarification. Doubler le nombre de GPU divise par deux la durée mais laisse inchangé le coût en heures-GPU, car le même travail total est simplement achevé plus tôt.
Exemple chiffré
Soit un entraînement de FLOP sur 1 024 accélérateurs cotés à 989 TFLOP/s chacun, soutenant un taux d'utilisation de 40 %, loués à 2,50 par GPU et par heure :
tT=1024×989×1012×0.45.88×1023≈1.45×106 s≈16.8 jours=36001.45×106×1024×2.50≈1032000L'entraînement dure environ dix-sept jours et coûte un peu plus d'un million en location de GPU. Porter le taux d'utilisation de 40 % à 50 % réduirait d'un cinquième la durée et le coût : tirer davantage du même matériel est ainsi l'optimisation la moins chère qui soit.
Limites
L'estimation suppose un entraînement limité par le calcul et un taux d'utilisation déjà moyenné sur toute la tâche. Elle exclut l'écriture des points de reprise, les attentes de chargement des données, les redémarrages après panne matérielle, les passes de validation et le temps d'inactivité d'une réservation maintenue sans calculer. Le réseau, le stockage et l'écart entre tarifs à la demande et réservés modifient aussi le total réel. Le résultat est à considérer comme une base de planification, à laquelle ajouter une marge pour les frais annexes. Le travail total qui alimente ce calcul est obtenu par le Calcul des FLOP d'entraînement, et la seule part de location de la facture par le Calculateur de coût GPU cloud.
Questions fréquentes (FAQ)
Comment la durée d'entraînement est-elle estimée ?
Le travail total en virgule flottante est divisé par le débit que la grappe peut soutenir. Ce débit correspond au nombre de GPU multiplié par le débit crête en TFLOP/s de chaque GPU et par le taux d'utilisation des FLOP du modèle, converti en opérations par seconde. En divisant le nombre total d'opérations par ce débit soutenu, on obtient la durée réelle en secondes, que le calcul exprime en jours, en heures ou en minutes.
L'estimation suppose que l'entraînement est limité par le calcul et que le taux d'utilisation rend déjà compte de l'efficacité moyenne sur l'ensemble de la tâche.
Quel taux d'utilisation faut-il retenir ?
Le taux d'utilisation des FLOP du modèle est la part du débit crête théorique réellement atteinte. Pour l'entraînement de grands modèles sur des systèmes bien optimisés, il se situe couramment entre 35 % et 55 %, 40 % constituant une valeur par défaut raisonnable. Les modèles plus petits, les séquences courtes, une communication intensive ou des noyaux de calcul non optimisés le font baisser.
Comme la durée varie de façon inverse au taux d'utilisation, le réduire de moitié double le calendrier prévu : une valeur mesurée lors d'un court profilage donne donc une estimation bien meilleure qu'une simple supposition.
Pourquoi la facture réelle peut-elle s'écarter de cette estimation ?
L'estimation ne compte que le calcul en régime permanent au taux d'utilisation choisi. Les entraînements réels y ajoutent l'écriture des points de reprise, les attentes liées au chargement des données, les redémarrages après panne, les passes de validation et le temps d'inactivité d'une réservation maintenue sans calculer.
Les tarifs à la demande ou réservés, les frais de réseau et de stockage, ainsi qu'un taux d'utilisation qui dérive au fil de l'entraînement modifient également le total. Ce chiffre est à considérer comme une base de planification, à laquelle ajouter une marge pour les frais annexes plutôt qu'à lire comme une facture exacte.
Mentions légales
Cette estimation suppose un entraînement limité par le calcul à un taux d'utilisation constant des FLOP du modèle et exclut les points de reprise, les attentes de chargement des données, les redémarrages, le réseau et le stockage. La durée et le coût réels varient selon le matériel, la pile logicielle et le modèle tarifaire ; le résultat est à considérer comme une base de planification.