El horizonte de las tareas (en inglés, time horizon) es una forma de medir la capacidad de un agente de inteligencia artificial que no usa puntuaciones abstractas sino minutos de trabajo humano. Se define como la duración de las tareas que el agente completa con éxito la mitad de las veces, medida por lo que tardan en hacerlas personas expertas. Si un agente tiene un horizonte de una hora, resuelve aproximadamente la mitad de las tareas que a un profesional le llevan una hora, casi todas las que le llevan cinco minutos y casi ninguna de las que le llevan un día. La propuso en marzo de 2025 METR, una organización sin ánimo de lucro de Berkeley dedicada a evaluar modelos, y se ha convertido en una de las cifras más citadas, y más discutidas, sobre el progreso de los agentes.
El trabajo, firmado por Thomas Kwa y más de veinte coautores, tiene dos partes. La primera es de medición. Reunieron ciento setenta tareas de programación, investigación en aprendizaje automático y ciberseguridad, desde encontrar un dato en un fichero hasta entrenar un modelo, y las cronometraron con personas expertas: más de ochocientas ejecuciones humanas que sumaban más de dos mil quinientas horas. Luego pusieron a trabajar en ellas a los modelos publicados desde 2019 y, para cada uno, ajustaron una curva que relaciona la duración humana de una tarea con la probabilidad de que el modelo la complete. El punto donde esa curva cruza el cincuenta por ciento es su horizonte. GPT-2, de 2019, tenía uno de unos dos segundos. Claude 3.7 Sonnet, el mejor modelo en el momento de publicar, de unos cincuenta minutos.
La segunda parte es la que hizo famoso al artículo: la tendencia. Ordenados por fecha de publicación, los horizontes de los modelos más avanzados de cada momento se doblaban aproximadamente cada siete meses, 207 días en la estimación central, con un intervalo de confianza de entre 166 y 240, y los modelos de 2024 y 2025 sugerían que el ritmo podía estar acelerándose. Si la tendencia se mantuviera y los resultados se trasladaran a tareas reales, extrapolaban los autores, en unos cinco años habría sistemas capaces de automatizar muchas tareas de software que hoy llevan un mes a una persona.
Lo más útil del artículo para quien construye agentes no está en la extrapolación, sino en una frase del resumen que suele pasarse por alto: el aumento del horizonte parece deberse sobre todo a una mayor fiabilidad y a una mayor capacidad de adaptarse a los propios errores, junto con mejor razonamiento y mejor uso de herramientas. No a que los modelos sepan más cosas, sino a que se equivocan menos veces por paso y, cuando se equivocan, lo notan.
La figura muestra la aritmética que hay debajo, con un modelo deliberadamente simple. Si cada paso de una tarea tiene una pequeña probabilidad de introducir un error y ningún error se corrige, la probabilidad de terminar bien cae de forma exponencial con la longitud: con un tres por ciento de error por paso, una tarea de veinte pasos sale bien algo más de la mitad de las veces, y el horizonte del cincuenta por ciento está en veintitrés pasos. Si el agente detecta y arregla la mitad de sus errores, el horizonte se dobla. Si arregla nueve de cada diez, se multiplica por diez. Para errores pequeños, el horizonte es inversamente proporcional a la tasa de errores que quedan sin corregir, de modo que cada vez que esa tasa se reduce a la mitad, por el motivo que sea, el horizonte se dobla. Una duplicación regular del horizonte cada siete meses equivale, en este modelo, a una reducción regular a la mitad de los errores no corregidos cada siete meses. Es una lectura mucho menos misteriosa de la curva de METR, y también mucho más accionable.
Porque la mitad de esa ecuación no depende del modelo, sino del sistema que lo rodea. La capacidad de detectar un error no es solo una propiedad interna: depende de que el entorno lo haga visible. Un agente de programación que ejecuta las pruebas después de cada cambio ve sus errores en segundos; uno que escribe un informe sin ninguna comprobación no ve ninguno. Cada una de las técnicas de esta colección se puede leer como una forma de mover el segundo deslizador de la figura. El bucle ReAct existe para que el modelo lea el resultado de cada acción. El evaluador-optimizador añade una revisión explícita, que funciona cuando hay una señal externa. El muestreo repetido cambia la corrección por la redundancia. Y gestionar el contexto, con subagentes o evitando la podredumbre del contexto, reduce los errores que nacen de leer mal lo que ya se tenía delante.
La lectura inversa es igual de importante. Si una tarea puede partirse en pasos fijos con comprobaciones entre ellos, no hace falta un agente de horizonte largo: hace falta una tubería de pasos cortos. Chunqiu Steven Xia y sus coautores de la Universidad de Illinois lo demostraron en 2024 con Agentless, un sistema para arreglar incidencias de código que no dejaba al modelo decidir nada: localizaba el fallo, generaba parches candidatos y los validaba con pruebas, en tres fases fijas. En SWE-bench Lite resolvió el 32 por ciento de las incidencias con un coste de setenta céntimos de dólar por incidencia, más que cualquier agente de código abierto de su momento y más barato que todos. Acortar la cadena es la otra manera de no caerse de ella.
La medida tiene límites que sus autores detallan con honestidad y que conviene conocer antes de repetir la cifra. Las tareas son de software e investigación, bien especificadas y con una comprobación automática al final, y no está claro cómo se traslada el resultado a trabajos más desordenados. El propio estudio calificó cada tarea según su grado de desorden, con una lista de factores que acercan una tarea al trabajo real, y los modelos rendían peor en las más desordenadas, aunque la tendencia de mejora era parecida en ambos grupos. El cincuenta por ciento es además un umbral generoso: los horizontes para un ochenta por ciento de éxito resultaban entre cuatro y seis veces más cortos, y un sistema que falla la mitad de las veces no es algo en lo que se pueda delegar sin supervisión. Y la duración humana de referencia es la de expertos que no conocían el contexto concreto de la tarea; alguien que lleva años en ese código lo haría bastante más rápido.
Con esas cautelas, el horizonte es probablemente la mejor forma disponible de responder a la pregunta que importa, cuánto trabajo se le puede encargar a un agente de una vez, y su lección práctica es independiente de cualquier extrapolación. La longitud de lo que un agente puede hacer solo no la fija lo que sabe, sino la frecuencia con que se equivoca sin enterarse. Quien diseña el sistema controla una parte grande de esa frecuencia: la que depende de cuántas veces, y con qué claridad, el mundo le dice al agente que se ha equivocado.
Fuentes
- Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment y otrosMeasuring AI Ability to Complete Long Software TasksAdvances in Neural Information Processing Systems 382025enlace
- Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan y Yuan CaoReAct: Synergizing Reasoning and Acting in Language ModelsInternational Conference on Learning Representations (ICLR)2023enlace
- Chunqiu Steven Xia, Yinlin Deng, Soren Dunn y Lingming ZhangAgentless: Demystifying LLM-based Software Engineering AgentsarXiv:2407.014892024enlace