Las claves verificadas
- Un eval prueba entradas y aplica criterios de calificación para medir si un sistema cumple una tarea. Ver evidencia
- Las evaluaciones de agentes pueden revisar trayectorias y artefactos, no solo la respuesta textual. Ver evidencia
- Los casos representativos y difíciles permiten comparar mejor un sistema que un promedio aislado. Ver evidencia
- Las métricas de machine learning deben elegirse según la tarea y el tipo de error que importa. Ver evidencia
Qué es un eval de IA
Un eval es una prueba repetible para comprobar si un sistema de inteligencia artificial cumple un criterio definido. Se le dan entradas representativas, se observa la salida y se aplica una regla de calificación. La prueba puede medir exactitud, formato, seguridad, tiempo, costo o la combinación que importa para un producto.
También puede servirte: Precisión, recall y F1 en IA: qué significan
La unidad evaluada no siempre es el modelo aislado. Puede incluir prompt, recuperación de documentos, herramientas, memoria y código que decide qué hacer con la respuesta. Si cambia cualquiera de esos componentes, el resultado puede cambiar aunque el modelo sea el mismo.
Cómo diseñar un conjunto de casos
Empezá por describir la tarea y el resultado aceptable con ejemplos concretos. Un conjunto útil incluye casos normales, entradas difíciles, solicitudes ambiguas y fallos que ya ocurrieron. No conviene medir solo los ejemplos fáciles porque el sistema puede optimizarse para un escenario que no representa el uso real.
Separá los datos de desarrollo de los que vas a reservar para comparar versiones. Si mirás las respuestas del conjunto final cada vez que ajustás el prompt, deja de ser una prueba independiente. Guardá la versión de los casos, las instrucciones y los criterios para poder explicar por qué cambió una puntuación.

Quién o qué califica la salida
Cuando hay una respuesta exacta, un programa puede comparar campos, ejecutar tests o verificar que una cita exista. En tareas abiertas se puede usar una rúbrica con criterios explícitos y revisión humana. Un modelo como juez ayuda a escalar la lectura, pero necesita ejemplos, controles y muestras revisadas por personas para detectar errores del evaluador.
La calificación debe mirar el artefacto que realmente recibe el usuario. En un agente puede ser el archivo creado, una llamada de herramienta, el estado de una base de datos o una respuesta final. Medir solo el texto intermedio puede dar una señal positiva aunque la tarea completa no se haya resuelto.
Cómo usar evals sin engañarse
Ejecutá la prueba antes de cambiar el sistema y repetila después de cada modificación relevante. Compará casos individuales además del promedio: una mejora general puede esconder una regresión en una situación crítica. Registrá también costo, latencia y errores de infraestructura cuando afecten la experiencia.
Un eval no demuestra que una IA sea correcta en todos los contextos. Mide el conjunto de casos y los criterios que definiste. Ampliá la cobertura con incidentes reales, revisiones periódicas y una vía para que las personas informen fallos nuevos; así la evaluación acompaña la evolución del producto en lugar de quedar congelada.

Qué aporta VisteEsto: Nuestro trabajo en esta nota
VisteEsto ordena el diseño de evals desde la tarea y los casos hasta la calificación, el seguimiento de regresiones y los límites de interpretar un promedio.
Fuentes, actualizaciones y metodología 3 fuentes
Fuentes consultadas
- Fuente primariaOpenAI: Evaluation best practices
- Fuente primariaAnthropic: Demystifying evals for AI agents
- Fuente primariaGoogle Machine Learning Crash Course
Historial de actualización
- Publicación inicial basada en guías oficiales de OpenAI, Anthropic y Google sobre evaluaciones, casos y criterios de calidad.
Cómo elaboramos esta nota
Definimos la consulta principal “qué son los evals en IA y cómo diseñarlos”, contrastamos los datos con 3 fuentes —3 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.



