Calculadora de tokens de imagen multimodal
Datos de entrada
| Anchura | 1.024 |
|---|---|
| Altura | 1.024 |
| Detalle | Detalle alto |
| Tokens base | 85 |
| Tokens por mosaico | 170 |
Calculadora de tokens de imagen multimodal
Estima cuántos tokens cobra un modelo de visión por una imagen a partir de sus dimensiones en píxeles y del nivel de detalle, según el método documentado de redimensionado y división en mosaicos.
Datos de entrada
Imagen
Constantes de tokens
Resultados
Introduce un valor para ver los resultados.
Detalles
Tokens de imagen multimodal
Cuando un modelo de lenguaje con capacidad de visión lee una imagen, no aplica una tarifa fija: convierte la imagen en un recuento de tokens y los factura a la misma tarifa que el texto. El recuento depende de las dimensiones en píxeles de la imagen y del nivel de detalle solicitado, según un procedimiento documentado de redimensionado y división en mosaicos. Esta calculadora reproduce ese procedimiento para estimar el coste en tokens de una imagen antes de enviarla, algo relevante porque una sola imagen de alta resolución puede costar más tokens que un párrafo de texto.
Cómo se construye el recuento
En el modo de detalle alto el modelo redimensiona la imagen en dos pasos y luego la cubre con mosaicos cuadrados. Primero la reduce para que quepa dentro de un cuadrado de 2048 píxeles si alguno de los lados supera ese valor, conservando la relación de aspecto:
s1=min(1, max(w,h)2048)Después la escala de nuevo para que el lado corto pase a ser de 768 píxeles:
s2=min(w⋅s1, h⋅s1)768La imagen redimensionada, de dimensiones , se divide en una cuadrícula de mosaicos de 512 píxeles, redondeando hacia arriba en cada eje para que los mosaicos parciales también cuenten:
k=⌈512w2⌉⋅⌈512h2⌉Cada mosaico cuesta un número fijo de tokens, y se añade un coste base fijo para cubrir la vista general en baja resolución que el modelo recibe siempre:
timg=t0+ttile⋅kEn el modo de detalle bajo se omite por completo la división en mosaicos y la imagen se factura solo con el coste base, .
Ejemplo resuelto
Tomemos una imagen de 1024×1024 en detalle alto, con un coste base de 85 tokens y 170 tokens por mosaico. Ningún lado supera 2048, de modo que el primer escalado la deja sin cambios; el segundo escalado lleva el lado corto a 768:
s2w2=h2=1024768=0.75=1024×0.75=768 pxLa cuadrícula de mosaicos es
k=⌈512768⌉⋅⌈512768⌉=2×2=4y el total es
timg=85+170×4=765 tokensA una tarifa de entrada intermedia de tres dólares por millón de tokens, esa única imagen cuesta alrededor de 0.0023 dólares: modesto por sí solo, pero un lote de miles de imágenes domina con rapidez un presupuesto pensado solo para texto.
Notas y variaciones
Como el lado corto queda fijado en 768 píxeles antes de la división en mosaicos, toda imagen que ya esté en ese tamaño o por encima produce la misma cuadrícula: una foto de 4096×4096 factura los mismos 765 tokens que el ejemplo de 1024×1024 anterior. Enviar mayor resolución no aporta detalle adicional más allá del límite ni coste adicional. Las constantes exactas —coste base, tamaño de los mosaicos, los umbrales de 2048 y 768— difieren entre proveedores y versiones de modelo, así que conviene tratar los valores por defecto de aquí como un esquema documentado y no como una regla universal.
Aplicación
Los tokens de imagen entran directamente en el precio por llamada: súmelos a los tokens de texto del prompt y calcule el precio del total con la Calculadora de coste de tokens. Cuando las imágenes se generan en lugar de leerse, su coste se estima por separado con la Calculadora de coste de generación de imágenes.
Preguntas frecuentes (FAQ)
¿Cómo determina el recuento de tokens la división en mosaicos?
El modelo redimensiona primero la imagen: la reduce para que quepa dentro de un cuadrado de 2048 píxeles si alguno de los lados es mayor, y la vuelve a escalar para que el lado corto mida 768 píxeles. La imagen redimensionada se divide en una cuadrícula de mosaicos de 512 píxeles, y cada mosaico cuesta un número fijo de tokens.
Además se suma un coste base fijo para cubrir la vista general en baja resolución que el modelo también recibe. El total es el coste base más el coste por mosaico multiplicado por el número de mosaicos.
¿Cuál es la diferencia entre el detalle bajo y el detalle alto?
El detalle alto ejecuta todo el procedimiento de redimensionado y división en mosaicos, de modo que el coste crece con el tamaño de la imagen y el modelo puede leer elementos finos como texto pequeño. El detalle bajo omite por completo la división en mosaicos y factura únicamente el coste base fijo, lo que ofrece al modelo una sola vista general aproximada a un precio fijo y menor.
El detalle bajo conviene a imágenes en las que solo importa el contenido global, como la forma de un gráfico o la categoría de una escena.
¿Enviar una imagen más grande cuesta más?
Hasta cierto punto. Como la imagen se redimensiona para que su lado corto pase a ser de 768 píxeles antes de la división en mosaicos, toda imagen que ya esté en ese tamaño o por encima produce la misma cuadrícula de mosaicos y el mismo recuento de tokens.
Enviar una foto en 4K en lugar de una imagen de 1024 píxeles no cuesta, por tanto, más en detalle alto, mientras que una imagen pequeña cuyo lado corto sea inferior a 768 píxeles puede producir menos mosaicos. El límite exacto y el tamaño de los mosaicos dependen del modelo.
Aviso legal
La contabilidad de tokens de visión varía según el proveedor y el modelo, y los proveedores la revisan con el tiempo. Los valores por defecto siguen un esquema documentado; confirme el coste base, el tamaño de los mosaicos y las reglas de redimensionado vigentes de su modelo concreto antes de basar una factura en una cifra.
Recomendaciones
Calculadora de coste de tokens
Calcula el coste de una sola llamada a la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del número de tokens de entrada y de salida y de los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.