# El evaluador-optimizador

- Sitio: Ikusmira — enciclopedia en castellano de ciencias sociales y humanidades
- URL canónica: https://ikusmira.org/p/el-evaluador-optimizador/
- Categoría: Informática
- Publicado: 2025-12-06
- Autoría: Josemari Sarasola Ledesma — Editor coordinador; Profesor titular de escuela universitaria, Universidad del País Vasco/Euskal Herriko Unibertsitatea
- Perfiles del autor: https://ekoizpen-zientifikoa.ehu.eus/investigadores/127490/detalle, https://dialnet.unirioja.es/servlet/autor?codigo=333202
- Política editorial (autoría, revisión, correcciones, financiación): https://ikusmira.org/politica-editorial/

El **evaluador-optimizador** es el patrón de diseño en el que un sistema de inteligencia artificial no da por buena su primera respuesta: una parte genera un resultado, otra lo evalúa y devuelve una crítica, y la primera lo rehace a la vista de la crítica, en un bucle que termina cuando la evaluación aprueba o cuando se agotan las rondas. Es el nombre que le dio Anthropic en su guía de diciembre de 2024, donde figura como el quinto de sus patrones básicos, y es la versión automática de algo que cualquiera que escriba conoce: el borrador, la lectura crítica, la segunda versión. Funciona de maravilla en unas tareas y empeora las cosas en otras, y la diferencia entre unas y otras no depende de lo bueno que sea el modelo, sino de dónde sale la crítica.

El patrón se popularizó en 2023 con dos artículos publicados con diez días de diferencia. El primero, *Self-Refine*, de Aman Madaan y sus coautores, usaba un único modelo para las tres funciones: generar, criticar y reescribir. Lo probaron en siete tareas, desde responder en un diálogo hasta optimizar código o resolver problemas de matemáticas, y el resultado refinado ganaba al primer intento en todas, con una mejora media de unos veinte puntos según las personas que juzgaban y las métricas automáticas. El segundo, *Reflexion*, de Noah Shinn y sus coautores, lo llevó a los agentes: después de cada intento fallido, el modelo escribía una reflexión en lenguaje natural sobre qué había salido mal, la guardaba en una memoria y la leía antes del intento siguiente. En la prueba de programación HumanEval alcanzó un 91 por ciento de aciertos al primer envío, frente al 80 que tenía GPT-4 solo.

La letra pequeña de ambos trabajos es donde está la lección. Reflexion obtenía su mejor resultado en programación, y en programación la señal de que algo ha salido mal no la inventa el modelo: la dan las pruebas, que se ejecutan y pasan o fallan. En cuanto a *Self-Refine*, las tareas donde más ganaba eran de las que admiten una mejora casi siempre, como hacer un texto más atractivo o un código más rápido, y donde menos, las de razonamiento matemático, donde una respuesta es correcta o no lo es.

En octubre de 2023, un equipo de Google DeepMind encabezado por Jie Huang publicó un artículo cuyo título ya era la conclusión: *Los grandes modelos de lenguaje todavía no saben autocorregir su razonamiento*. Distinguieron con cuidado dos cosas que la literatura mezclaba. Una es la autocorrección con **señal externa**: el modelo revisa su respuesta después de recibir información que no tenía, el resultado de unas pruebas, el error de un compilador, la respuesta de una búsqueda. La otra es la **autocorrección intrínseca**: el modelo revisa su respuesta solo con lo que ya sabía, porque alguien le pide que la repase. Varios trabajos anteriores que parecían mostrar lo segundo usaban, sin decirlo, lo primero: paraban el bucle cuando la respuesta coincidía con la correcta, lo que equivale a tener un oráculo que avisa de cuándo se ha acertado. Sin ese oráculo, en problemas de matemáticas y de sentido común, los modelos no mejoraban al revisar, y a menudo empeoraban: cambiaban respuestas correctas por incorrectas con más frecuencia que al revés.



La figura explica por qué pasa esto con dos números. Si en cada ronda la revisión arregla una fracción de los errores y estropea una fracción de los aciertos, la proporción de respuestas correctas no crece sin fin: se acerca a un equilibrio en el que lo que se arregla compensa exactamente lo que se estropea, y ese equilibrio es la fracción que arregla dividida por la suma de las dos. Lo que determina el resultado final es ese cociente, y no la calidad del primer intento. Con unas pruebas automáticas que nunca rechazan una solución correcta, la fracción que se estropea es cero, un acierto no se vuelve a tocar, y el bucle solo puede mejorar hasta acercarse al cien por cien. Con una revisión que no aporta información nueva, las dos fracciones se parecen y el equilibrio queda cerca de la mitad; si el primer intento ya estaba por encima de ese equilibrio, revisar lo arrastra hacia abajo. El modelo no sabe más en la segunda vuelta que en la primera. Solo tiene una segunda oportunidad de equivocarse.

La revisión más completa del tema, publicada por Ryo Kamoi y sus coautores en 2024, llega a la misma conclusión con otras palabras. Después de repasar la literatura con criterios estrictos, no encuentran ningún trabajo que demuestre una autocorrección eficaz con críticas generadas por el propio modelo sin señal externa, salvo en tareas excepcionalmente adecuadas para ello; encuentran que funciona bien cuando hay retroalimentación externa fiable; y encuentran que un ajuste fino específico a gran escala puede enseñar a los modelos a corregirse. Es un resultado de 2024, y los modelos entrenados después con técnicas de razonamiento largo revisan su propio trabajo mejor que los de entonces. Pero el mecanismo de la figura no depende del modelo: mientras la revisión pueda estropear aciertos, habrá un equilibrio, y conviene medirlo antes de añadir rondas.

La consecuencia para quien diseña agentes es un criterio de una sola pregunta: ¿de dónde sale la señal del evaluador? Si sale de algo que se ejecuta y se comprueba, pruebas, un compilador, un validador de formato, una consulta a una base de datos cuyo resultado se puede contrastar, el patrón es probablemente el más rentable de todos, y explica buena parte de por qué los agentes de programación funcionan antes y mejor que los de casi cualquier otro dominio. Si sale de otro modelo que juzga, el patrón funciona en la medida en que ese [juez automático](https://ikusmira.org/p/el-juez-automatico/) sea mejor distinguiendo lo bueno de lo malo que el generador produciéndolo, lo que ocurre a menudo en criterios de forma, como el tono, la longitud o el cumplimiento de unas instrucciones, y mucho menos en criterios de verdad. Y si sale del propio generador sin nada nuevo delante, lo que se obtiene es una segunda opinión del mismo autor.

Hay dos detalles de ingeniería que marcan la diferencia en la práctica. El primero es separar de verdad las dos funciones: el evaluador trabaja mejor con instrucciones propias, un criterio explícito escrito como lista de comprobaciones y, a ser posible, sin ver el razonamiento que llevó a la respuesta, porque un razonamiento convincente contamina el juicio de quien lo lee. El segundo es el criterio de parada. Un bucle que se detiene cuando el evaluador aprueba hereda todos los falsos positivos del evaluador; uno que se detiene tras un número fijo de rondas paga siempre el máximo. La figura sugiere la regla razonable: pocas rondas, dos o tres, porque la mayor parte de la mejora llega pronto y las siguientes se acercan al equilibrio sin cruzarlo, y un registro de cuántas respuestas cambia cada ronda y en qué sentido, que es la única forma de saber si el bucle está arreglando o estropeando. Lo mismo vale para la variante en la que no se revisa una respuesta sino que se generan [varias y se elige](https://ikusmira.org/p/el-muestreo-repetido/), donde el papel del evaluador es todavía más decisivo.

## Fuentes

- Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri y otros — *Self-Refine: Iterative Refinement with Self-Feedback*, Advances in Neural Information Processing Systems 36 (2023) — https://arxiv.org/abs/2303.17651
- Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan y Shunyu Yao — *Reflexion: Language Agents with Verbal Reinforcement Learning*, Advances in Neural Information Processing Systems 36 (2023) — https://arxiv.org/abs/2303.11366
- Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song y Denny Zhou — *Large Language Models Cannot Self-Correct Reasoning Yet*, International Conference on Learning Representations (ICLR) (2024) — https://arxiv.org/abs/2310.01798
- Ryo Kamoi, Yusen Zhang, Nan Zhang, Jiawei Han y Rui Zhang — *When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs*, Transactions of the Association for Computational Linguistics 12 (2024) — https://arxiv.org/abs/2406.01297
- Erik Schluntz y Barry Zhang — *Building effective agents*, Anthropic Engineering (2024) — https://www.anthropic.com/engineering/building-effective-agents

---

Cómo citar: Sarasola, Josemari (2025). «El evaluador-optimizador». Ikusmira. https://ikusmira.org/p/el-evaluador-optimizador/
Índice del sitio para modelos: https://ikusmira.org/llms.txt
