Qué es y cómo funciona
RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) divide el trabajo en dos fases. Primero, un buscador localiza en tus documentos los fragmentos más relacionados con la pregunta. Después, esos fragmentos se incluyen en la petición al modelo junto con la pregunta, con la instrucción de responder apoyándose en ellos.
Para que la primera fase funcione hay que preparar los datos: dividir los documentos en trozos de tamaño manejable, convertir cada trozo en un embedding y guardarlo en un índice, normalmente una base de datos vectorial. Al llegar una pregunta se hace lo mismo con ella y se buscan los trozos más cercanos. Muchas implementaciones combinan esta búsqueda semántica con la búsqueda por palabras clave y añaden un paso de reordenación.
La calidad del resultado depende más de la recuperación que del modelo: si llegan fragmentos equivocados o incompletos, el modelo responderá mal aunque sea muy capaz. Por eso gran parte del trabajo real está en limpiar documentos, trocearlos bien y medir qué recupera el sistema.
Por qué importa
RAG es la vía más habitual para que una IA hable de tu negocio sin reentrenar nada. Los datos se actualizan cambiando los documentos del índice, puedes controlar qué información ve cada usuario y, si muestras las fuentes usadas, quien lee la respuesta puede comprobarla.
Reduce las alucinaciones, pero no las elimina. Además hay costes continuos: mantener el índice al día, pagar las llamadas al modelo y revisar periódicamente la calidad de las respuestas. También hay que decidir qué documentos se indexan y quién puede verlos, porque una mala gestión de permisos puede exponer información interna.
Un ejemplo
Una gestoría quiere un asistente interno para consultar sus manuales de procedimientos y las circulares que recibe. Los documentos se trocean e indexan, y cuando un empleado pregunta, el sistema recupera los pasajes relevantes y el modelo redacta la respuesta indicando de qué documento sale cada dato. Si no se encuentra nada adecuado, el asistente responde que no tiene información en lugar de inventarla, y cada documento nuevo se incorpora al índice.
Errores y confusiones frecuentes
- Pensar que basta con subir los documentos y listo. Sin trocear con criterio, limpiar el texto y probar con preguntas reales, la recuperación falla y las respuestas parecen buenas pero son incorrectas.
- Indexar contenido desactualizado o contradictorio. El sistema no sabe qué versión es la vigente: si tu base documental está desordenada, el RAG heredará el desorden.
- No usarlo cuando no toca: si los datos caben cómodamente en la petición, o si la información es una tabla que se consulta mejor con una consulta SQL exacta, un RAG añade complejidad y fuentes de error sin aportar nada.
