Calculadora de similitud del coseno
Datos de entrada
| Componente a₁ | 0,5 |
|---|---|
| Componente a₂ | 0,1 |
| Componente a₃ | -0,3 |
| Componente b₁ | 0,4 |
| Componente b₂ | 0,2 |
| Componente b₃ | -0,1 |
Calculadora de similitud del coseno
Calcule la similitud del coseno y el ángulo entre dos vectores a partir de sus componentes, la forma habitual de medir cuánto se parecen dos embeddings de texto.
Datos de entrada
Vector A
Vector B
Resultados
Introduce un valor para ver los resultados.
Detalles
Similitud del coseno
La similitud del coseno mide hasta qué punto dos vectores apuntan en la misma dirección. Es el coseno del ángulo que forman, de modo que depende únicamente de su orientación y no de su longitud. La puntuación va de menos uno, para vectores que apuntan en direcciones exactamente opuestas, pasando por cero, para vectores en ángulo recto, hasta más uno, para vectores alineados en la misma dirección. Es la forma habitual de comparar embeddings de texto, donde la dirección de un vector codifica el significado y su longitud es en gran medida accesoria. Esta calculadora trabaja en tres dimensiones para que la aritmética resulte fácil de seguir, pero la fórmula y su interpretación son idénticas en los cientos o miles de dimensiones que ocupa un embedding real.
Cómo se calcula
Dos ingredientes se combinan para dar la puntuación. El producto escalar mide cuánto coinciden los vectores componente a componente, y las normas miden sus longitudes. Para los vectores y el producto escalar es
a⋅b=a1b1+a2b2+a3b3y la norma de un vector es la raíz cuadrada de la suma de sus componentes al cuadrado,
∥a∥=a12+a22+a32Dividir el producto escalar por las dos normas cancela el efecto de la longitud y deja solo el ángulo:
cosθ=∥a∥∥b∥a⋅bEl ángulo en sí se obtiene invirtiendo el coseno, , lo que a veces resulta más fácil de interpretar que la puntuación bruta: una similitud de 0,92 cuesta más de imaginar que un ángulo de unos veintitrés grados.
Ejemplo resuelto
Se comparan con . El producto escalar es
a⋅b=(0,5)(0,4)+(0,1)(0,2)+(−0,3)(−0,1)=0,20+0,02+0,03=0,25Las normas son
∥a∥∥b∥=0,25+0,01+0,09=0,35=0,5916=0,16+0,04+0,01=0,21=0,4583de modo que la similitud del coseno es
cosθ=0,5916×0,45830,25=0,27110,25=0,9221lo que corresponde a un ángulo de . Los dos vectores están próximos pero no son idénticos: se inclinan claramente en la misma dirección, con algo más de veinte grados de separación. En una búsqueda con embeddings, una puntuación tan alta marcaría los dos elementos como una coincidencia fuerte.
Notas y variaciones
Cuando los vectores se normalizan de antemano a longitud unitaria, ambas normas son iguales a uno y la similitud del coseno se reduce solo al producto escalar, razón por la cual las bases de datos vectoriales almacenan embeddings normalizados y ordenan los resultados con una única multiplicación y suma. La similitud del coseno también guarda una relación estrecha con la distancia euclídea sobre la esfera unitaria: para vectores unitarios, una similitud del coseno mayor implica siempre una distancia en línea recta menor, de modo que ambos órdenes coinciden. Las puntuaciones solo son comparables dentro de un mismo modelo de embeddings; un valor de 0,8 de un modelo no significa lo mismo que un 0,8 de otro.
Aplicación
La similitud del coseno es el paso de puntuación que hay detrás de la búsqueda con embeddings, que sustenta la generación aumentada por recuperación. Los pasajes que compara los produce una etapa de fragmentación —véase Calculadora de fragmentación RAG— y se convierten en vectores cuyo coste estima Calculadora de coste de embeddings. El número de esos vectores que un sistema debe comparar determina el tamaño del índice que calcula Calculadora de tamaño de base de datos vectorial.
Preguntas frecuentes (FAQ)
¿En qué se diferencia la similitud del coseno de la distancia euclídea?
La distancia euclídea mide la separación en línea recta entre los extremos de dos vectores y es sensible a sus longitudes. La similitud del coseno mide únicamente el ángulo entre ellos e ignora la longitud por completo.
Dos embeddings que apuntan en la misma dirección pero difieren en magnitud tienen una distancia euclídea grande y, sin embargo, una similitud del coseno cercana a 1. En los embeddings de texto, la dirección porta el significado y la magnitud es en gran medida accesoria, por lo que el ángulo suele ser la comparación más informativa.
¿Qué rango toma la similitud del coseno?
Va de −1 a +1. Un valor de +1 significa que los vectores apuntan exactamente en la misma dirección, 0 significa que son ortogonales y no comparten ninguna dirección común, y −1 significa que apuntan en direcciones opuestas.
Los modelos de embeddings suelen entrenarse para que el texto no relacionado quede cerca de 0 y el texto relacionado puntúe bastante por encima, aunque la escala exacta depende del modelo, y muchos modelos rara vez producen valores fuertemente negativos.
¿Por qué las búsquedas con embeddings usan la similitud del coseno?
Un embedding codifica el significado como una dirección en un espacio de muchas dimensiones, y dos pasajes significan cosas parecidas cuando sus vectores apuntan en direcciones parecidas, con independencia de su longitud. La similitud del coseno capta exactamente esa comparación basada solo en la dirección.
Además resulta barata de calcular a gran escala: una vez normalizados los vectores a longitud unitaria, la similitud del coseno se reduce a un único producto escalar, que las bases de datos vectoriales pueden evaluar con rapidez sobre millones de entradas.
Aviso legal
Una puntuación de similitud del coseno solo es significativa en relación con otras puntuaciones del mismo modelo de embeddings. No existe un umbral universal que marque dos elementos como similares; calíbrelo con ejemplos de sus propios datos antes de extraer conclusiones.