Las claves verificadas

  • RAG combina la memoria paramétrica de un modelo con una memoria externa recuperable. Ver evidencia
  • Un flujo RAG recupera información relevante y la agrega al contexto antes de generar una respuesta. Ver evidencia
  • Los documentos suelen dividirse y representarse mediante embeddings en un índice vectorial. Ver evidencia
  • Actualizar la fuente externa permite cambiar el conocimiento disponible sin volver a entrenar el modelo base. Ver evidencia

Qué es RAG y qué problema intenta resolver

RAG significa Retrieval-Augmented Generation, o generación aumentada por recuperación. Es una arquitectura que combina un modelo generativo con un sistema de búsqueda: antes de responder, recupera fragmentos externos relacionados con la consulta y los incorpora al contexto que recibe el modelo.

El trabajo original de 2020 combinó memoria paramétrica, contenida en el modelo, con una memoria no paramétrica formada por un índice externo. En aplicaciones actuales, esa fuente puede ser una colección de manuales, políticas, artículos, fichas de productos o documentos internos.

El recorrido desde los documentos hasta la respuesta

Primero se preparan los documentos: se limpian, dividen en fragmentos y, a menudo, se convierten en representaciones numéricas llamadas embeddings. Cuando llega una pregunta, el buscador compara su significado con el índice y selecciona los fragmentos considerados más pertinentes.

Después, un orquestador agrega esos fragmentos a la consulta y envía el conjunto al modelo. El modelo genera la respuesta usando ese contexto. Las fuentes pueden adjuntarse como citas, pero esa trazabilidad depende de que la aplicación conserve la relación entre cada fragmento y su documento original.

Documentos divididos e indexados para un sistema RAG
Los documentos se preparan e indexan para recuperar fragmentos relevantes. · VisteEsto · Fuente · VisteEsto editorial

La cadena de calidad: recuperar antes de generar

RAG no garantiza una respuesta correcta. Si el índice está desactualizado, los fragmentos son demasiado grandes o pequeños, los permisos filtran mal o la búsqueda recupera contenido irrelevante, el modelo parte de una base defectuosa. También puede ignorar evidencia o combinarla de forma incorrecta.

Para evaluarlo, separá recuperación y generación. Primero medí si aparecen los documentos que contienen la respuesta; después revisá si la respuesta respeta esos documentos, cita el origen correcto y reconoce cuando falta evidencia. Esa cadena permite detectar si el problema está en los datos, el buscador, el prompt o el modelo.

Cadena de evaluación de recuperación contexto y generación
Separar las etapas ayuda a encontrar dónde se origina una respuesta deficiente. · VisteEsto · Fuente · VisteEsto editorial
Qué aporta VisteEsto: Nuestro trabajo en esta nota

VisteEsto convierte la arquitectura RAG en una cadena de calidad que permite separar errores de datos, recuperación, contexto y generación.

Fuentes, actualizaciones y metodología 3 fuentes

Fuentes consultadas

Historial de actualización

  • Publicación inicial basada en el artículo original de RAG y documentación de AWS y Google Cloud.

Cómo elaboramos esta nota

Definimos la consulta principal “qué es RAG en inteligencia artificial y cómo funciona”, contrastamos los datos con 3 fuentes —3 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.

Siguiente historiaA16z crea un fondo de US$1.100 millones para hardware