Glosario · IA y automatización

Embedding

Representación numérica (vector) de un texto, imagen o entidad. Dos contenidos similares producen vectores cercanos. Es la base de búsqueda semántica, recomendaciones y RAG.

Qué es y cómo funciona

Un embedding es una lista de números que representa el significado aproximado de un contenido, normalmente un texto aunque también puede ser una imagen u otro tipo de dato. Lo genera un modelo especializado: recibe el contenido y devuelve un vector de longitud fija. La propiedad útil es que contenidos con significado parecido producen vectores próximos entre sí, aunque no compartan las mismas palabras.

Eso permite medir la similitud con operaciones matemáticas sencillas, como la distancia o el ángulo entre dos vectores. Así, una búsqueda de «cómo cancelo mi suscripción» puede encontrar una página titulada «Darse de baja del servicio», cosa que una búsqueda por palabras exactas no haría.

Hay detalles que importan: cada modelo de embeddings produce vectores propios, y los de un modelo no son comparables con los de otro. Si cambias de modelo, tienes que recalcular todos los vectores guardados. Además, los números no son interpretables por una persona; solo tienen sentido al compararlos entre sí.

Por qué importa

Los embeddings son la pieza que hace posible la búsqueda semántica, la detección de contenidos duplicados o relacionados, las recomendaciones y la fase de recuperación de un sistema RAG. Mejoran la experiencia de un buscador interno cuando los usuarios no saben qué palabras exactas usar.

Tienen costes y límites. Calcular los vectores de un gran volumen de documentos tiene un coste y hay que repetirlo si cambias de modelo. La búsqueda por similitud no distingue bien matices como las negaciones o las cifras exactas, así que para códigos de producto, referencias o nombres propios suele funcionar mejor combinarla con búsqueda por palabras clave.

Un ejemplo

Una tienda online tiene un centro de ayuda con cientos de artículos. Se calcula el embedding de cada artículo y se guarda. Cuando un cliente escribe «no me ha llegado el pedido», se calcula el embedding de esa frase y se muestran los artículos con vectores más cercanos, como el de seguimiento de envíos o el de incidencias en la entrega. Para buscar un número de pedido concreto, el sistema sigue usando una búsqueda exacta.

Errores y confusiones frecuentes

  • Mezclar vectores de modelos distintos en el mismo índice. No son comparables y los resultados dejan de tener sentido; al cambiar de modelo hay que reindexar todo.
  • Dar por hecho que «cercano» significa «correcto». La similitud semántica encuentra contenido parecido, no necesariamente la respuesta exacta, y puede devolver resultados plausibles pero irrelevantes.
  • Enviar a un proveedor externo contenidos sensibles para calcular los vectores. Aunque el resultado sea un vector, el texto original sí sale de tu sistema y entra en el ámbito del RGPD si contiene datos personales.
Dudas habituales

Preguntas frecuentes sobre Embedding

No. Un token es un trozo de texto que el modelo de lenguaje procesa como unidad de entrada. Un embedding es un vector numérico que representa el significado de un texto completo, o de un fragmento, y se usa para compararlo con otros.

No de forma directa, pero tampoco conviene tratar los vectores como información anónima: existen técnicas que reconstruyen parte del contenido. Si el texto es sensible, protege los vectores con los mismos controles de acceso que los documentos originales.

¿Necesitas aplicarlo en tu proyecto?

Cuéntanos qué quieres conseguir y te decimos, sin compromiso, si Embedding tiene sentido en tu caso o si hay una opción mejor.