Glosario · IA y automatización

RAG — Retrieval-Augmented Generation

Patrón en el que el LLM recibe, junto a la pregunta, fragmentos relevantes recuperados de una base vectorial. Permite responder con datos propios y actualizados sin re-entrenar el modelo.

Qué es y cómo funciona

RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) divide el trabajo en dos fases. Primero, un buscador localiza en tus documentos los fragmentos más relacionados con la pregunta. Después, esos fragmentos se incluyen en la petición al modelo junto con la pregunta, con la instrucción de responder apoyándose en ellos.

Para que la primera fase funcione hay que preparar los datos: dividir los documentos en trozos de tamaño manejable, convertir cada trozo en un embedding y guardarlo en un índice, normalmente una base de datos vectorial. Al llegar una pregunta se hace lo mismo con ella y se buscan los trozos más cercanos. Muchas implementaciones combinan esta búsqueda semántica con la búsqueda por palabras clave y añaden un paso de reordenación.

La calidad del resultado depende más de la recuperación que del modelo: si llegan fragmentos equivocados o incompletos, el modelo responderá mal aunque sea muy capaz. Por eso gran parte del trabajo real está en limpiar documentos, trocearlos bien y medir qué recupera el sistema.

Por qué importa

RAG es la vía más habitual para que una IA hable de tu negocio sin reentrenar nada. Los datos se actualizan cambiando los documentos del índice, puedes controlar qué información ve cada usuario y, si muestras las fuentes usadas, quien lee la respuesta puede comprobarla.

Reduce las alucinaciones, pero no las elimina. Además hay costes continuos: mantener el índice al día, pagar las llamadas al modelo y revisar periódicamente la calidad de las respuestas. También hay que decidir qué documentos se indexan y quién puede verlos, porque una mala gestión de permisos puede exponer información interna.

Un ejemplo

Una gestoría quiere un asistente interno para consultar sus manuales de procedimientos y las circulares que recibe. Los documentos se trocean e indexan, y cuando un empleado pregunta, el sistema recupera los pasajes relevantes y el modelo redacta la respuesta indicando de qué documento sale cada dato. Si no se encuentra nada adecuado, el asistente responde que no tiene información en lugar de inventarla, y cada documento nuevo se incorpora al índice.

Errores y confusiones frecuentes

  • Pensar que basta con subir los documentos y listo. Sin trocear con criterio, limpiar el texto y probar con preguntas reales, la recuperación falla y las respuestas parecen buenas pero son incorrectas.
  • Indexar contenido desactualizado o contradictorio. El sistema no sabe qué versión es la vigente: si tu base documental está desordenada, el RAG heredará el desorden.
  • No usarlo cuando no toca: si los datos caben cómodamente en la petición, o si la información es una tabla que se consulta mejor con una consulta SQL exacta, un RAG añade complejidad y fuentes de error sin aportar nada.

Conceptos relacionados

Dudas habituales

Preguntas frecuentes sobre RAG

No. Las reduce al dar al modelo información concreta, pero puede interpretar mal un fragmento, mezclar fuentes o responder aunque la recuperación haya fallado. Mostrar las fuentes y permitir una respuesta del tipo «no lo sé» ayuda a controlar el riesgo.

En un RAG los documentos se guardan en tu índice y solo se envían al modelo los fragmentos necesarios en cada consulta. Si el proveedor los reutiliza para entrenar depende de sus condiciones, así que conviene revisarlas y firmar el contrato de tratamiento de datos correspondiente.

Si lo que necesitas es que el modelo conozca datos propios y cambiantes, RAG suele ser más sencillo y barato de mantener. El fine-tuning se plantea cuando necesitas cambiar el comportamiento o el estilo del modelo, no cuando solo le faltan datos.

¿Necesitas aplicarlo en tu proyecto?

Cuéntanos qué quieres conseguir y te decimos, sin compromiso, si RAG tiene sentido en tu caso o si hay una opción mejor.