Calculateur de tokens d'image multimodale
Données
| Largeur | 1 024 |
|---|---|
| Hauteur | 1 024 |
| Détail | Détail élevé |
| Tokens de base | 85 |
| Tokens par tuile | 170 |
Calculateur de tokens d'image multimodale
Estimez le nombre de tokens qu'un modèle de vision facture pour une image à partir de ses dimensions en pixels et du niveau de détail, selon la méthode documentée de redimensionnement et de découpage en tuiles.
Données
Image
Constantes de tokens
Résultats
Saisissez une valeur pour afficher les résultats.
Détails
Tokens d'image multimodale
Lorsqu'un modèle de langage doté de vision lit une image, il ne facture pas un forfait fixe : il convertit l'image en un nombre de tokens et facture ces tokens au même tarif que le texte. Ce nombre dépend des dimensions en pixels de l'image et du niveau de détail demandé, selon une procédure documentée de redimensionnement puis de découpage en tuiles. Ce calculateur reproduit cette procédure afin d'estimer le coût en tokens d'une image avant de l'envoyer, un point qui compte car une seule image en haute résolution peut coûter plus de tokens qu'un paragraphe de texte.
Comment le nombre se construit
En mode détail élevé, le modèle redimensionne l'image en deux étapes, puis la recouvre de tuiles carrées. Il commence par la réduire pour qu'elle tienne dans un carré de 2 048 pixels si l'un de ses côtés dépasse cette valeur, en conservant le rapport d'aspect :
s1=min(1, max(w,h)2048)Il la redimensionne ensuite à nouveau pour que le côté le plus court atteigne 768 pixels :
s2=min(w⋅s1, h⋅s1)768L'image redimensionnée, de dimensions , est divisée en une grille de tuiles de 512 pixels, en arrondissant vers le haut sur chaque axe pour que les tuiles partielles soient comptées :
k=⌈512w2⌉⋅⌈512h2⌉Chaque tuile coûte un nombre fixe de tokens, auquel s'ajoute un coût de base forfaitaire couvrant l'aperçu en basse résolution que le modèle reçoit toujours :
timg=t0+ttile⋅kEn mode détail faible, le découpage en tuiles est entièrement ignoré et l'image est facturée au seul coût de base, .
Exemple détaillé
Prenons une image de 1024×1024 en détail élevé, avec un coût de base de 85 tokens et 170 tokens par tuile. Aucun côté ne dépasse 2 048, donc le premier redimensionnement la laisse inchangée ; le second ramène le côté le plus court à 768 :
s2w2=h2=1024768=0,75=1024×0,75=768 pxLa grille de tuiles est
k=⌈512768⌉⋅⌈512768⌉=2×2=4et le total vaut
timg=85+170×4=765 tokensÀ un tarif d'entrée de milieu de gamme de trois dollars par million de tokens, cette unique image coûte environ 0,0023 dollar — modeste prise isolément, mais un lot de plusieurs milliers d'images domine vite un budget consacré au seul texte.
Remarques et variantes
Comme le côté le plus court est fixé à 768 pixels avant le découpage en tuiles, toute image déjà à cette taille ou au-delà produit la même grille : une photo de 4096×4096 facture les mêmes 765 tokens que l'exemple de 1024×1024 ci-dessus. Envoyer une résolution supérieure n'apporte ni détail ni coût supplémentaire au-delà du plafond. Les constantes exactes — coût de base, taille des tuiles, seuils de 2 048 et 768 — diffèrent selon les fournisseurs et les versions de modèle ; il convient donc de traiter les valeurs par défaut proposées ici comme un schéma documenté parmi d'autres, et non comme une règle universelle.
Application
Les tokens d'image alimentent directement la tarification par appel : il suffit de les ajouter aux tokens de texte de la requête et de chiffrer le total avec le Calculateur de coût en jetons. Lorsque les images sont elles-mêmes générées plutôt que lues, leur coût est estimé séparément par le Calcul du coût de génération d'images.
Questions fréquentes (FAQ)
Comment le découpage en tuiles détermine-t-il le nombre de tokens ?
Le modèle redimensionne d'abord l'image : il la réduit pour la faire tenir dans un carré de 2 048 pixels si l'un des côtés est plus grand, puis la redimensionne à nouveau pour que le côté court mesure 768 pixels. L'image redimensionnée est divisée en une grille de tuiles de 512 pixels, et chaque tuile coûte un nombre fixe de tokens.
Un coût de base fixe s'ajoute par-dessus pour couvrir l'aperçu en basse résolution que le modèle reçoit également. Le total est le coût de base plus le coût par tuile multiplié par le nombre de tuiles.
Quelle est la différence entre le détail faible et le détail élevé ?
Le détail élevé exécute toute la procédure de redimensionnement et de découpage en tuiles, de sorte que le coût croît avec la taille de l'image et que le modèle peut lire les éléments fins tels que les petits textes. Le détail faible ignore entièrement le découpage en tuiles et ne facture que le coût de base fixe, donnant au modèle un seul aperçu grossier à un prix fixe et moindre.
Le détail faible convient aux images où seul le contenu global importe, comme la forme d'un graphique ou la catégorie d'une scène.
Envoyer une image plus grande coûte-t-il davantage ?
Jusqu'à un certain point. Comme l'image est redimensionnée pour que son côté court devienne 768 pixels avant le découpage en tuiles, toute image déjà à cette taille ou au-dessus produit la même grille de tuiles et le même nombre de tokens.
Envoyer une photo en 4K plutôt qu'une image de 1 024 pixels ne coûte donc pas plus cher en détail élevé, tandis qu'une petite image dont le côté court est inférieur à 768 pixels peut produire moins de tuiles. Le plafond exact et la taille des tuiles dépendent du modèle.
Mentions légales
La comptabilité des tokens de vision varie selon le fournisseur et le modèle, et les fournisseurs la révisent au fil du temps. Les valeurs par défaut suivent un schéma documenté ; confirmez le coût de base, la taille des tuiles et les règles de redimensionnement actuels de votre modèle avant de vous fier à un chiffre pour la facturation.