Las claves verificadas
- RAG combina la memoria paramétrica de un modelo con una memoria externa recuperable. Ver evidencia
- Un flujo RAG recupera información relevante y la agrega al contexto antes de generar una respuesta. Ver evidencia
- Los documentos suelen dividirse y representarse mediante embeddings en un índice vectorial. Ver evidencia
- Actualizar la fuente externa permite cambiar el conocimiento disponible sin volver a entrenar el modelo base. Ver evidencia
Qué es RAG y qué problema intenta resolver
RAG significa Retrieval-Augmented Generation, o generación aumentada por recuperación. Es una arquitectura que combina un modelo generativo con un sistema de búsqueda: antes de responder, recupera fragmentos externos relacionados con la consulta y los incorpora al contexto que recibe el modelo.
También puede servirte: A16z crea un fondo de US$1.100 millones para hardware
El trabajo original de 2020 combinó memoria paramétrica, contenida en el modelo, con una memoria no paramétrica formada por un índice externo. En aplicaciones actuales, esa fuente puede ser una colección de manuales, políticas, artículos, fichas de productos o documentos internos.
El recorrido desde los documentos hasta la respuesta
Primero se preparan los documentos: se limpian, dividen en fragmentos y, a menudo, se convierten en representaciones numéricas llamadas embeddings. Cuando llega una pregunta, el buscador compara su significado con el índice y selecciona los fragmentos considerados más pertinentes.
Después, un orquestador agrega esos fragmentos a la consulta y envía el conjunto al modelo. El modelo genera la respuesta usando ese contexto. Las fuentes pueden adjuntarse como citas, pero esa trazabilidad depende de que la aplicación conserve la relación entre cada fragmento y su documento original.

La cadena de calidad: recuperar antes de generar
RAG no garantiza una respuesta correcta. Si el índice está desactualizado, los fragmentos son demasiado grandes o pequeños, los permisos filtran mal o la búsqueda recupera contenido irrelevante, el modelo parte de una base defectuosa. También puede ignorar evidencia o combinarla de forma incorrecta.
Para evaluarlo, separá recuperación y generación. Primero medí si aparecen los documentos que contienen la respuesta; después revisá si la respuesta respeta esos documentos, cita el origen correcto y reconoce cuando falta evidencia. Esa cadena permite detectar si el problema está en los datos, el buscador, el prompt o el modelo.

Qué aporta VisteEsto: Nuestro trabajo en esta nota
VisteEsto convierte la arquitectura RAG en una cadena de calidad que permite separar errores de datos, recuperación, contexto y generación.
Fuentes, actualizaciones y metodología 3 fuentes
Fuentes consultadas
- Fuente primariaLewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- Fuente primariaAWS Prescriptive Guidance: Understanding RAG
- Fuente primariaGoogle Cloud: What is Retrieval-Augmented Generation
Historial de actualización
- Publicación inicial basada en el artículo original de RAG y documentación de AWS y Google Cloud.
Cómo elaboramos esta nota
Definimos la consulta principal “qué es RAG en inteligencia artificial y cómo funciona”, contrastamos los datos con 3 fuentes —3 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.



