Calcolatore dei token delle immagini multimodali
Dati di input
| Larghezza | 1.024 |
|---|---|
| Altezza | 1.024 |
| Dettaglio | Dettaglio alto |
| Token base | 85 |
| Token per riquadro | 170 |
Calcolatore dei token delle immagini multimodali
Stima quanti token un modello di visione addebita per un'immagine a partire dalle sue dimensioni in pixel e dal livello di dettaglio, secondo il conteggio documentato di ridimensionamento e suddivisione in riquadri.
Dati di input
Immagine
Costanti dei token
Risultati
Inserisci un valore per visualizzare i risultati.
Dettagli
Token delle immagini multimodali
Quando un modello linguistico con capacità di visione legge un'immagine, non applica una tariffa fissa: converte l'immagine in un conteggio di token e fattura quei token alla stessa tariffa del testo. Il conteggio dipende dalle dimensioni in pixel dell'immagine e dal livello di dettaglio richiesto, secondo una procedura documentata di ridimensionamento e suddivisione in riquadri. Questo calcolatore riproduce tale procedura per stimare il costo in token di un'immagine prima di inviarla, cosa che conta perché una singola immagine ad alta risoluzione può costare più token di un paragrafo di testo.
Come si costruisce il conteggio
In modalità dettaglio alto il modello ridimensiona l'immagine in due passaggi e poi la copre con riquadri quadrati. Prima la riduce affinché rientri in un quadrato di 2048 pixel se uno dei lati lo supera, preservando le proporzioni:
s1=min(1, max(w,h)2048)Poi la riscala nuovamente in modo che il lato minore diventi 768 pixel:
s2=min(w⋅s1, h⋅s1)768L'immagine ridimensionata, di dimensioni , viene divisa in una griglia di riquadri da 512 pixel, arrotondando per eccesso su ciascun asse in modo che anche i riquadri parziali vengano contati:
k=⌈512w2⌉⋅⌈512h2⌉Ogni riquadro costa un numero fisso di token, e un costo base fisso viene aggiunto a copertura della panoramica a bassa risoluzione che il modello riceve sempre:
timg=t0+ttile⋅kIn modalità dettaglio basso la suddivisione viene saltata del tutto e l'immagine è fatturata al solo costo base, .
Esempio svolto
Si prenda un'immagine di 1024×1024 in dettaglio alto, con un costo base di 85 token e 170 token per riquadro. Nessun lato supera 2048, quindi il primo ridimensionamento la lascia invariata; il secondo porta il lato minore a 768:
s2w2=h2=1024768=0,75=1024×0,75=768 pxLa griglia di riquadri è
k=⌈512768⌉⋅⌈512768⌉=2×2=4e il totale è
timg=85+170×4=765 tokenA una tariffa di ingresso di fascia media di tre dollari per milione di token, quella singola immagine costa circa 0,0023 dollari — modesto da solo, ma un lotto di migliaia di immagini domina rapidamente un budget di solo testo.
Note e varianti
Poiché il lato minore viene fissato a 768 pixel prima della suddivisione, qualsiasi immagine già a quella dimensione o superiore produce la stessa griglia: una foto di 4096×4096 fattura gli stessi 765 token dell'esempio 1024×1024 qui sopra. Inviare una risoluzione più alta non acquista dettaglio aggiuntivo oltre il limite né costo aggiuntivo. Le costanti esatte — costo base, dimensione del riquadro, le soglie di 2048 e 768 — differiscono tra fornitori e versioni di modello, quindi conviene trattare i valori predefiniti qui come uno schema documentato e non come una regola universale.
Applicazione
I token delle immagini confluiscono direttamente nel prezzo per chiamata: si sommano ai token di testo del prompt e si quota il totale con il Calcolatore del costo dei token. Quando le immagini stesse sono generate anziché lette, il loro costo è stimato separatamente dall' Calcolatore del costo di generazione delle immagini.
Domande frequenti (FAQ)
Come la suddivisione in riquadri determina il conteggio dei token?
Il modello ridimensiona prima l'immagine: la riduce affinché rientri in un quadrato di 2.048 pixel se uno dei lati è più grande, poi la riscala nuovamente in modo che il lato minore sia di 768 pixel. L'immagine ridimensionata viene divisa in una griglia di riquadri da 512 pixel, e ogni riquadro costa un numero fisso di token.
A questo si aggiunge un costo base fisso a copertura della panoramica a bassa risoluzione che il modello riceve anch'essa. Il totale è il costo base più il costo per riquadro moltiplicato per il numero di riquadri.
Qual è la differenza tra dettaglio basso e alto?
Il dettaglio alto esegue l'intera procedura di ridimensionamento e suddivisione, quindi il costo cresce con le dimensioni dell'immagine e il modello può leggere elementi minuti come testo piccolo. Il dettaglio basso salta del tutto la suddivisione e fattura solo il costo base fisso, fornendo al modello una singola panoramica approssimativa a un prezzo fisso e più basso.
Il dettaglio basso è adatto a immagini in cui conta solo il contenuto complessivo, come la forma di un grafico o la categoria di una scena.
Inviare un'immagine più grande costa di più?
Fino a un certo punto. Poiché l'immagine viene ridimensionata in modo che il lato minore diventi 768 pixel prima della suddivisione, qualsiasi immagine già a quella dimensione o superiore produce la stessa griglia di riquadri e lo stesso conteggio di token.
Inviare una foto in 4K invece di una da 1.024 pixel non costa quindi di più in dettaglio alto, mentre un'immagine piccola con lato minore inferiore a 768 pixel può produrre meno riquadri. Il limite esatto e la dimensione del riquadro dipendono dal modello.
Avvertenze legali
Il conteggio dei token di visione varia in base al fornitore e al modello, e i fornitori lo rivedono nel tempo. I valori predefiniti seguono uno schema documentato; conviene verificare il costo base, la dimensione del riquadro e le regole di ridimensionamento aggiornate per il proprio modello specifico prima di basare una stima di fatturazione su una cifra.