Las claves verificadas

  • OpenAI calcula 3,1 jornadas de agentes por cada jornada humana en su organización de investigación. Ver evidencia
  • La empresa afirma haber alcanzado un nivel de pasante capaz de ejecutar tareas definidas de varios días bajo dirección humana. Ver evidencia
  • Más de la mitad de las tareas exitosas estimadas en 4 a 8 horas requirió una o más intervenciones humanas. Ver evidencia

Qué ocurrió

OpenAI publicó una medición interna sobre cómo sus investigadores usan agentes de código. A mediados de agosto, la organización acumulaba 3,1 jornadas equivalentes de ejecución de agentes por cada jornada laboral humana de ocho horas.

La empresa también afirma haber alcanzado su meta de un pasante de investigación automatizado: un sistema capaz de completar tareas bien definidas que a una persona especializada podrían llevarle varios días, siempre bajo dirección humana.

Los datos muestran más código y experimentos, pero OpenAI advierte que esas variables no equivalen directamente a progreso científico. Cómputo, diseño de evaluaciones, decisiones y revisión de seguridad pueden convertirse en nuevos cuellos de botella.

Cálculo: qué significa la relación 3,1 a 1

La relación 3,1 a 1 suma tiempo de ejecución, no tres investigadores virtuales autónomos. Varios agentes pueden trabajar en paralelo mientras una persona define tareas, revisa resultados, corrige errores y decide qué experimento merece continuar.

Una jornada de agente tampoco equivale automáticamente a una jornada humana de calidad comparable. El informe convierte horas de ejecución a bloques de ocho horas para describir volumen; no asigna una tasa uniforme de productividad o valor científico.

Diagrama del proceso de compilación y enlace de código
Diagrama técnico de compilación de software; imagen de archivo. · D. Justen · Fuente · CC BY 4.0

La dependencia de supervisión aparece en otra métrica: entre las tareas exitosas estimadas en cuatro a ocho horas, más de la mitad necesitó al menos una intervención. Eso indica que el resultado combina automatización con dirección y corrección humana.

Qué límites tiene la evidencia

La fuente primaria confirma el dato central y describe el método, pero pertenece a la organización que presenta el resultado. Las cifras necesitan conservar definición, período y población para evitar comparaciones falsas.

VisteEsto separa capacidad, uso y resultado. Una capacidad técnica habilita una tarea; el uso muestra que se ejecutó; el resultado exige una métrica ligada a calidad, seguridad o conocimiento nuevo.

Una actualización útil debería publicar datos comparables, errores y cambios de método. Sin esa continuidad, una cifra aislada funciona como fotografía del momento y no como tendencia demostrada.

Cómo seguir el resultado

El aporte original permite ubicar el límite de cada afirmación. También identifica el próximo dato que debería aparecer para decidir si la promesa se convirtió en una mejora repetible.

Las referencias complementarias aportan contexto, pero no reemplazan una evaluación independiente del caso concreto. Si aparecen diferencias, deben revisarse fecha, alcance y condiciones antes de elegir una conclusión.

Equipo de especialistas trabaja frente a varias pantallas
Personas supervisan sistemas informáticos; imagen de archivo. · NOAA National Severe Storms Laboratory · Fuente · CC BY 2.0

Por ahora, la evidencia sostiene el hecho documentado y las restricciones declaradas. Cualquier generalización a otros equipos, modelos u observaciones necesita pruebas adicionales.

El costo también muestra intensidad: el investigador mediano llegó a más de US$600 diarios de inferencia a precios de API, mientras el percentil 90 superó US$7.000. Es una valuación interna de consumo, no necesariamente el gasto contable marginal de OpenAI.

En agosto, los experimentos por investigador activo alcanzaron el máximo desde enero de 2025. OpenAI observa correlación con la adopción de Codex y al mismo tiempo reconoce que su capacidad de cómputo creció; los datos publicados no aíslan cuánto aporta cada factor.

Qué aporta VisteEsto: Nuestro trabajo en esta nota

VisteEsto realizó un cálculo o verificación específica para distinguir la métrica publicada de lo que todavía no puede concluirse.

Fuentes, actualizaciones y metodología 3 fuentes

Fuentes consultadas

Historial de actualización

  • Publicación inicial con fuentes verificadas y aporte original visible.

Cómo elaboramos esta nota

Definimos la consulta principal “OpenAI 3,1 jornadas agentes investigación”, contrastamos los datos con 3 fuentes —1 primaria— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.

Siguiente historiaOpenAI destina US$1.000 millones a ciberdefensa