Calculadora de coste de embeddings
Datos de entrada
| Número de documentos | 500 |
|---|---|
| Tokens por documento | 1.000 |
| Precio (por 1M de tokens) | 0,13 $ |
Calculadora de coste de embeddings
Estima el coste único de generar embeddings de un corpus de documentos para recuperación, a partir del número de documentos, los tokens por documento y el precio por millón de tokens del modelo de embeddings.
Datos de entrada
Corpus
Precio
Resultados
Introduce un valor para ver los resultados.
Detalles
Definición
El coste de embeddings es el precio de convertir un conjunto de texto en vectores mediante un modelo de embeddings. Antes de que un sistema de recuperación pueda responder preguntas sobre una colección de documentos, debe transformar cada documento en un embedding: una lista de números de longitud fija que captura su significado. Las API de embeddings miden este trabajo en tokens y facturan a una tarifa publicada por millón de tokens, de modo que el coste de preparar un corpus depende de cuántos documentos hay y de la extensión de cada uno.
Cálculo de la factura
Un modelo de embeddings lee texto y devuelve un vector por cada entrada. El proveedor cuenta los tokens de entrada —el mismo tipo de token que se usa en la generación de texto, unos cuatro caracteres en inglés cada uno— y aplica la tarifa por token. Como un solo token cuesta una fracción mínima de una unidad monetaria, las tarifas se expresan por millón de tokens. Los modelos de embeddings suelen ser mucho más baratos por token que los de generación, ya que realizan una sola pasada hacia adelante y no producen salida generada.
El coste es un cargo único por documento. Una vez que el vector de un documento queda almacenado en una base de datos vectorial, no es necesario volver a generarlo salvo que cambie el contenido o se sustituya el modelo de embeddings: los vectores de modelos distintos no son comparables, así que cambiar de modelo implica regenerar el embedding de todo el corpus.
Fórmula
Con un corpus de documentos de tokens de media cada uno, el recuento total de tokens es
T=ndoc⋅tdocy generar los embeddings del corpus a una tarifa de por millón de tokens cuesta
C=106T⋅pLa división por convierte la tarifa por millón en una tarifa por token antes de multiplicar por el recuento de tokens.
Ejemplo
Supongamos que una base de conocimiento contiene pasajes de tokens de media, procesados con un modelo cuyo precio es de $0.13 por millón de tokens. El recuento total de tokens es
T=1800×740=1332000 tokensy el coste de los embeddings es
C=1061332000×0.13=1.332×0.13≈0.17Es decir, generar los embeddings de todo el corpus cuesta alrededor de diecisiete céntimos: un gasto único que se paga al construir el índice. Incluso un corpus un orden de magnitud mayor se mantiene en cifras bajas de un solo dígito, motivo por el cual los embeddings rara vez son la partida dominante en el presupuesto de un sistema de recuperación.
Notas y variaciones
La cifra anterior cubre únicamente el embedding inicial de los documentos. Hay tres costes relacionados que se facturan aparte: el embedding de cada consulta del usuario en tiempo de ejecución (pequeño, porque las consultas son breves), el almacenamiento de los vectores en una base de datos vectorial y la regeneración cuando los documentos cambian. Dividir los documentos en fragmentos más pequeños aumenta el número de documentos pero reduce los tokens por documento, de modo que el producto —y, por tanto, el coste— se mantiene cerca del total de tokens en bruto, más un pequeño solapamiento.
Aplicación
El coste de embeddings es el primer paso para presupuestar una canalización de recuperación. Los vectores que produce hay que almacenarlos y consultarlos, que es el objeto de Calculadora de coste de base de datos vectorial, y la huella de almacenamiento depende de la dimensión y el número de vectores que trata Calculadora de tamaño de base de datos vectorial. Las llamadas de generación que consumen el contexto recuperado se tarifan con Calculadora de coste de tokens.
Preguntas frecuentes (FAQ)
¿Qué es un embedding?
Un embedding es una lista de números —un vector— que representa el significado de un fragmento de texto. Un modelo de embeddings lee un documento y devuelve un vector de longitud fija, de modo que los textos con significado parecido quedan próximos en ese espacio vectorial.
Los sistemas de recuperación generan el embedding de cada documento una sola vez, almacenan los vectores y, en el momento de la consulta, generan el embedding de la pregunta y devuelven los documentos más cercanos.
¿Cómo se estiman los tokens por documento?
Como regla práctica, un token equivale a unos cuatro caracteres en inglés, o aproximadamente 0,75 palabras, de modo que un artículo de 1.000 palabras se acerca a los 1.300 tokens. El código, las tablas y los textos en alfabetos no latinos se tokenizan de forma menos eficiente y producen más tokens por carácter. Para una cifra precisa, conviene pasar una muestra de los documentos por el tokenizador del proveedor y calcular la media.
¿Hay que pagar este coste de nuevo?
La generación del embedding es un cargo único por documento mientras se conserven los vectores. Solo se paga otra vez al añadir documentos nuevos, cuando el contenido cambia y debe regenerarse, o al cambiar de modelo de embeddings, ya que los vectores de un modelo no son comparables con los de otro. Los embeddings de las consultas que se generan en tiempo de ejecución se facturan aparte y suelen ser pequeños.
Aviso legal
Esta es una estimación única para generar los embeddings del corpus y excluye el embedding de las consultas, el almacenamiento de los vectores y la regeneración cuando el contenido cambia. El recuento de tokens depende del tokenizador del modelo y del contenido, y los precios publicados varían con el tiempo. Conviene verificar las tarifas y el recuento de tokens actuales con el proveedor.
Recomendaciones
Calculadora de coste de tokens
Calcula el coste de una sola llamada a la interfaz de programación (API) de un modelo de lenguaje grande (LLM) a partir del número de tokens de entrada y de salida y de los precios del modelo por millón de tokens, con la entrada y la salida facturadas por separado.