Similitud del Coseno (Cosine Similarity)
Métrica matemática que mide el ángulo entre dos vectores en un espacio multidimensional. Indica el grado de afinidad semántica entre dos textos de -1 (opuestos) a +1 (sinónimos completos), ignorando la longitud de las oraciones.
1. Visión general del concepto y problema sistémico
Imagina dos brújulas. Si ambas agujas apuntan al norte, el ángulo entre ellas es cero, y la dirección coincide perfectamente. Si una apunta al norte y la otra al este, el ángulo es de 90 grados.
Similitud del Coseno (Cosine Similarity) es esa brújula para las redes neuronales:
- Toma dos vectores (coordenadas numéricas del significado de dos frases).
- Mide el ángulo entre ellos en el espacio de conceptos.
- Devuelve un número de
0.0a1.0(o de -1 a 1), donde 1.0 es la afinidad semántica absoluta.
Es una fórmula matemática fundamental que permite que ChatGPT busque en archivos, Notion AI y bases de datos vectoriales.
2. Taxonomía arquitectónica y modelo mental
^ Concepto de comida
│
│ / Texto A: «Comprar pan fresco»
│ /
│ / ) ángulo cercano a 0° -> coseno ≈ 0.96
│ /
│ /---- Texto B: «Panecillo de la panadería»
│
│
│─────────────────────────────> Concepto de IT
│ Texto C: «Escribir un script en Python»
│ (ángulo 90° -> coseno ≈ 0.04)
3. Por qué el ángulo es mejor que la longitud absoluta
En geometría tradicional, cuanto más larga es una línea, más lejos está su extremo. Si midiésemos la distancia convencional:
- La palabra
«automóvil»(vector corto). - Un artículo de Wikipedia sobre la construcción de automóviles de 10 páginas (vector muy largo con muchas palabras).
La distancia euclidiana los consideraría cosas diferentes, ya que un texto es corto y el otro largo. Pero el coseno solo evalúa la dirección del vector de pensamientos, entendiendo que ambos textos están completamente dedicados al transporte.
4. Escenarios prácticos de ingeniería en producción
| Calificación de similitud | Qué significa | Ejemplo de par de oraciones |
|---|---|---|
| 0.90 – 1.00 | Sinónimo directo o duplicado | «Cómo cambiar una rueda» ↔ «Instrucciones para montar un neumático» |
| 0.75 – 0.89 | Vínculo contextual estrecho | «Tarjeta de crédito» ↔ «Tasa de interés de un préstamo» |
| 0.40 – 0.70 | Vínculo tangencial distante | «Smartphone Apple» ↔ «Batería para coche eléctrico» |
| 0.00 – 0.30 | Ausencia total de relación | «Cultivo de fresas» ↔ «Claves criptográficas SSH» |
5. Errores comunes, trampas y seguridad
Cuando configuras la búsqueda en una base de conocimientos o en un chatbot corporativo, a menudo ves el parámetro similarity_threshold = 0.75. Ahora sabes: este es un filtro de coseno que elimina todos los documentos cuyo ángulo de desviación de la consulta del usuario supera el margen de error permitido.
FAQ: Similitud del Coseno (Cosine Similarity)
Términos relacionados
Embeddings Simplificados (Cómo el Texto se Convierte en Números)
Tecnología fundamental que transforma palabras, oraciones o imágenes en listas multidimensionales de números (vectores). Permite a los ordenadores medir matemáticamente la proximidad semántica entre diferentes ideas y conceptos.
Bases de Datos Vectoriales (Vector DBs & Búsqueda ANN)
Sistemas de gestión de bases de datos especializados y extensiones (Qdrant, pgvector, Milvus, Chroma, Turso), optimizados para almacenar millones de vectores multidimensionales y realizar búsquedas aproximadas de vecinos más cercanos (Approximate Nearest Neighbors) de manera ultrarrápida.
Búsqueda Semántica (Búsqueda por Contenido, No por Letras)
Tecnología de búsqueda de información basada en el contenido conceptual de la consulta, no en la coincidencia exacta de letras o palabras clave. Comprende sinónimos, parafraseos, errores ortográficos y preguntas abstractas en lenguaje natural.