Qué es y cómo funciona
Un embedding es una lista de números que representa el significado aproximado de un contenido, normalmente un texto aunque también puede ser una imagen u otro tipo de dato. Lo genera un modelo especializado: recibe el contenido y devuelve un vector de longitud fija. La propiedad útil es que contenidos con significado parecido producen vectores próximos entre sí, aunque no compartan las mismas palabras.
Eso permite medir la similitud con operaciones matemáticas sencillas, como la distancia o el ángulo entre dos vectores. Así, una búsqueda de «cómo cancelo mi suscripción» puede encontrar una página titulada «Darse de baja del servicio», cosa que una búsqueda por palabras exactas no haría.
Hay detalles que importan: cada modelo de embeddings produce vectores propios, y los de un modelo no son comparables con los de otro. Si cambias de modelo, tienes que recalcular todos los vectores guardados. Además, los números no son interpretables por una persona; solo tienen sentido al compararlos entre sí.
Por qué importa
Los embeddings son la pieza que hace posible la búsqueda semántica, la detección de contenidos duplicados o relacionados, las recomendaciones y la fase de recuperación de un sistema RAG. Mejoran la experiencia de un buscador interno cuando los usuarios no saben qué palabras exactas usar.
Tienen costes y límites. Calcular los vectores de un gran volumen de documentos tiene un coste y hay que repetirlo si cambias de modelo. La búsqueda por similitud no distingue bien matices como las negaciones o las cifras exactas, así que para códigos de producto, referencias o nombres propios suele funcionar mejor combinarla con búsqueda por palabras clave.
Un ejemplo
Una tienda online tiene un centro de ayuda con cientos de artículos. Se calcula el embedding de cada artículo y se guarda. Cuando un cliente escribe «no me ha llegado el pedido», se calcula el embedding de esa frase y se muestran los artículos con vectores más cercanos, como el de seguimiento de envíos o el de incidencias en la entrega. Para buscar un número de pedido concreto, el sistema sigue usando una búsqueda exacta.
Errores y confusiones frecuentes
- Mezclar vectores de modelos distintos en el mismo índice. No son comparables y los resultados dejan de tener sentido; al cambiar de modelo hay que reindexar todo.
- Dar por hecho que «cercano» significa «correcto». La similitud semántica encuentra contenido parecido, no necesariamente la respuesta exacta, y puede devolver resultados plausibles pero irrelevantes.
- Enviar a un proveedor externo contenidos sensibles para calcular los vectores. Aunque el resultado sea un vector, el texto original sí sale de tu sistema y entra en el ámbito del RGPD si contiene datos personales.
