Calculadora de Tokens de Imagem Multimodal
Entradas
| Largura | 1.024 |
|---|---|
| Altura | 1.024 |
| Detalhe | Detalhe alto |
| Tokens-Base | 85 |
| Tokens por Ladrilho | 170 |
Calculadora de Tokens de Imagem Multimodal
Estime quantos tokens um modelo de visão cobra por uma imagem a partir de suas dimensões em pixels e do nível de detalhe, usando a contabilidade documentada de redimensionamento e ladrilhamento.
Entradas
Imagem
Constantes de token
Resultados
Insira um valor para ver os resultados.
Detalhes
Tokens de imagem multimodal
Quando um modelo de linguagem com visão lê uma imagem, ele não cobra uma taxa fixa — converte a imagem em uma contagem de tokens e cobra esses tokens à mesma taxa do texto. A contagem depende das dimensões em pixels da imagem e do nível de detalhe solicitado, seguindo um procedimento documentado de redimensionamento e ladrilhamento. Esta calculadora reproduz esse procedimento para que você possa estimar o custo em tokens de uma imagem antes de enviá-la, o que importa porque uma única imagem em alta resolução pode custar mais tokens do que um parágrafo de texto.
Como a contagem é montada
No modo de detalhe alto, o modelo redimensiona a imagem em duas etapas e depois a cobre com ladrilhos quadrados. Primeiro, ele a reduz para caber dentro de um quadrado de 2048 pixels se algum dos lados exceder esse valor, preservando a proporção:
s1=min(1, max(w,h)2048)Depois, redimensiona de novo para que o lado menor fique com 768 pixels:
s2=min(w⋅s1, h⋅s1)768A imagem redimensionada, de dimensões , é dividida em uma grade de ladrilhos de 512 pixels, arredondando para cima em cada eixo para que ladrilhos parciais também contem:
k=⌈512w2⌉⋅⌈512h2⌉Cada ladrilho custa um número fixo de tokens, e um custo-base fixo é somado para cobrir a visão geral em baixa resolução que o modelo sempre recebe:
timg=t0+ttile⋅kNo modo de detalhe baixo, o ladrilhamento é pulado por completo e a imagem é cobrada apenas pelo custo-base, .
Exemplo resolvido
Considere uma imagem de 1024×1024 em detalhe alto, com custo-base de 85 tokens e 170 tokens por ladrilho. Nenhum dos lados excede 2048, então o primeiro redimensionamento a deixa inalterada; o segundo leva o lado menor a 768:
s2w2=h2=1024768=0,75=1024×0,75=768 pxA grade de ladrilhos é
k=⌈512768⌉⋅⌈512768⌉=2×2=4e o total é
timg=85+170×4=765 tokensA uma taxa de entrada intermediária de três dólares por milhão de tokens, essa única imagem custa cerca de 0,0023 dólar — modesto isoladamente, mas um lote de milhares de imagens rapidamente domina um orçamento só de texto.
Observações e variações
Como o lado menor é fixado em 768 pixels antes do ladrilhamento, qualquer imagem já nesse tamanho ou acima dele produz a mesma grade: uma foto de 4096×4096 é cobrada pelos mesmos 765 tokens do exemplo de 1024×1024 acima. Enviar uma resolução maior não compra nenhum detalhe extra além do limite nem nenhum custo adicional. As constantes exatas — custo-base, tamanho do ladrilho, os limites de 2048 e 768 — diferem entre provedores e versões de modelo, então trate os valores padrão aqui como um esquema documentado, e não como uma regra universal.
Aplicação
Os tokens de imagem entram diretamente no preço por chamada: some-os aos tokens de texto do prompt e calcule o preço do total com a Calculadora de Custo por Token. Quando as próprias imagens são geradas em vez de lidas, seu custo é estimado separadamente pela Calculadora de Custo de Geração de Imagens.
Perguntas frequentes (FAQ)
Como o ladrilhamento da imagem determina a contagem de tokens?
O modelo primeiro redimensiona a imagem: ele a reduz para caber em um quadrado de 2.048 pixels se algum dos lados for maior, depois reduz de novo para que o lado menor fique com 768 pixels. A imagem redimensionada é dividida em uma grade de ladrilhos de 512 pixels, e cada ladrilho custa um número fixo de tokens.
Um custo-base fixo é somado por cima para cobrir a visão geral em baixa resolução que o modelo também recebe. O total é o custo-base mais o custo por ladrilho vezes o número de ladrilhos.
Qual a diferença entre detalhe baixo e detalhe alto?
O detalhe alto executa todo o procedimento de redimensionamento e ladrilhamento, então o custo cresce com o tamanho da imagem e o modelo consegue ler elementos finos, como texto pequeno. O detalhe baixo pula o ladrilhamento por completo e cobra apenas o custo-base fixo, dando ao modelo uma única visão geral grosseira por um preço fixo e mais baixo.
O detalhe baixo serve para imagens em que só o conteúdo geral importa, como o formato de um gráfico ou a categoria de uma cena.
Enviar uma imagem maior custa mais?
Até certo ponto. Como a imagem é redimensionada para que seu lado menor fique com 768 pixels antes do ladrilhamento, qualquer imagem já nesse tamanho ou acima dele produz a mesma grade de ladrilhos e a mesma contagem de tokens.
Enviar uma foto em 4K em vez de uma de 1.024 pixels, portanto, não custa mais no detalhe alto, enquanto uma imagem pequena, abaixo de 768 pixels no lado menor, pode produzir menos ladrilhos. O limite exato e o tamanho do ladrilho dependem do modelo.
Aviso legal
A contabilidade de tokens de visão varia conforme o provedor e o modelo, e os provedores a revisam ao longo do tempo. Os valores padrão seguem um esquema documentado; confirme o custo-base, o tamanho do ladrilho e as regras de redimensionamento atuais do seu modelo específico antes de confiar em um número para cobrança.