Las claves verificadas
- Precisión mide la fracción de positivos predichos que son verdaderos positivos; recall mide la fracción de positivos reales que el modelo encontró. Ver evidencia
- Cambiar el umbral modifica el equilibrio entre precisión y recall. Ver evidencia
- F1 combina precisión y recall mediante su media armónica. Ver evidencia
- TensorFlow ofrece una métrica Precision configurable por umbral. Ver evidencia
Qué miden precisión y recall
En un clasificador, precisión responde cuántos de los casos marcados como positivos eran realmente positivos. Recall, también llamado sensibilidad, responde cuántos de los positivos que existían logró encontrar el modelo. Las dos métricas usan la matriz de confusión, que separa aciertos y errores.
También puede servirte: Qué es el aprendizaje automático y cómo usa datos
Un modelo puede tener precisión alta y recall bajo si solo se anima a marcar casos muy seguros. También puede encontrar casi todos los positivos a costa de generar más falsos positivos. Mirar una sola cifra oculta ese intercambio.
Dónde entra el umbral de decisión
Muchos clasificadores producen una probabilidad o puntuación y luego aplican un umbral para decidir la etiqueta. Bajar el umbral suele recuperar más positivos y subir el recall, pero también puede aumentar falsos positivos y reducir la precisión. El valor correcto depende del costo de cada error.
La curva precision-recall muestra cómo cambia esa relación cuando se prueban distintos umbrales. En un filtro de fraude, por ejemplo, puede ser preferible investigar más casos antes que dejar pasar una operación riesgosa; en una alerta automática, demasiados falsos positivos pueden hacer que la gente ignore el sistema.

Qué es el puntaje F1
El puntaje F1 resume precisión y recall mediante su media armónica. Solo alcanza un valor alto cuando las dos métricas son razonables, por eso resulta útil cuando se busca un equilibrio y no hay una prioridad clara entre falsos positivos y falsos negativos.
F1 no reemplaza a las métricas separadas. Dos modelos pueden compartir el mismo F1 y comportarse de manera distinta: uno puede tener más precisión y menos recall, y otro el patrón inverso. La decisión debe mostrar qué errores importan para la tarea.
Cómo elegir una métrica para una IA
Primero definí qué significa un positivo y qué consecuencia tiene cada error. Después separá datos de entrenamiento, validación y prueba, elegí un umbral con datos que no se usen para medir el resultado final y reportá la matriz de confusión junto con precisión, recall y F1 cuando corresponda.
La exactitud puede parecer alta si una clase es muy frecuente, aunque el modelo ignore la clase minoritaria. En esos casos conviene mirar métricas por clase, el soporte y la curva precision-recall. La métrica sirve para comparar decisiones concretas, no para declarar que una IA “entiende” el problema.

Qué aporta VisteEsto: Nuestro trabajo en esta nota
VisteEsto conecta la matriz de confusión con decisiones prácticas: umbral, costos de error, equilibrio F1 y clases desbalanceadas.
Fuentes, actualizaciones y metodología 3 fuentes
Fuentes consultadas
- Fuente primariaGoogle ML Crash Course: accuracy, precision and recall
- Fuente primariascikit-learn: model evaluation
- Fuente primariaTensorFlow: Precision metric
Historial de actualización
- Publicación inicial basada en Google ML Crash Course, scikit-learn y TensorFlow sobre precisión, recall, F1 y umbrales.
Cómo elaboramos esta nota
Definimos la consulta principal “qué significan precision recall y f1 en IA”, contrastamos los datos con 3 fuentes —3 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.



