Qué es y cómo funciona
Una base de datos vectorial guarda embeddings junto con los datos asociados a cada uno, como el texto original, el documento de procedencia o permisos de acceso. Su función principal es responder a la pregunta «¿cuáles son los vectores más cercanos a este?» de forma rápida, aunque haya millones de ellos.
Comparar un vector con todos los demás sería lento a gran escala, así que estas bases usan índices de vecinos aproximados. Esos índices renuncian a garantizar el resultado exacto a cambio de velocidad: pueden pasar por alto algún vecino real. Se ajusta el equilibrio entre precisión, velocidad y memoria según el caso de uso.
Existen servicios dedicados y también extensiones de bases de datos que ya conoces. PostgreSQL, por ejemplo, dispone de la extensión pgvector, que añade esta capacidad a una base relacional. También se puede filtrar por metadatos, como el idioma, la fecha o el cliente, combinando la similitud con las condiciones de una consulta normal.
Por qué importa
Es el almacén que sostiene la recuperación en un sistema RAG y en cualquier búsqueda semántica. Elegirlo bien afecta al coste de operación, a la latencia de las respuestas y a cuánto trabajo de mantenimiento recae en tu equipo.
Para volúmenes moderados, usar la base de datos que ya tienes con una extensión vectorial suele ser más simple: una pieza menos que operar y copias de seguridad ya resueltas. Un servicio especializado se justifica con grandes volúmenes o requisitos de rendimiento exigentes. En ambos casos conviene revisar dónde se alojan los datos y quién tiene acceso, porque los vectores derivan de tus documentos.
Un ejemplo
Una aplicación SaaS ya guarda sus datos en PostgreSQL y quiere añadir un buscador semántico sobre la documentación de cada cliente. En lugar de contratar un servicio nuevo, añade una columna de vectores a la tabla existente y filtra siempre por el identificador del cliente, de modo que una consulta nunca devuelva contenido de otra cuenta. Si el volumen crece mucho más adelante, podrá replantearse la elección con datos reales de rendimiento.
Errores y confusiones frecuentes
- Elegir un servicio especializado por moda sin comprobar si tu base actual basta. Añadir un componente nuevo significa más coste, más seguridad que revisar y otro sistema que mantener sincronizado.
- Olvidar el control de acceso. Si todos los documentos viven en el mismo índice y no filtras por permisos, un usuario podría recibir fragmentos que no debería ver.
- Ignorar la sincronización. Cuando un documento cambia o se borra, su vector debe actualizarse o eliminarse; si no, el sistema seguirá recuperando contenido obsoleto o que debía desaparecer, también por motivos de derecho de supresión del RGPD.
