La podredumbre del contexto (en inglés, context rot) es el nombre que ha recibido en el oficio un hecho medido una y otra vez desde 2023: los modelos de lenguaje no usan igual de bien todo lo que se les da a leer. Recuperan mejor lo que está al principio y al final de su entrada que lo que está en medio, y rinden peor, en conjunto, cuanto más larga es la entrada, aunque la tarea no cambie y aunque la entrada quepa holgadamente en lo que el fabricante anuncia como su ventana de contexto. Para quien construye agentes es probablemente el límite práctico más importante de la técnica, porque un agente es, por construcción, un programa que alarga su propio contexto en cada paso.
El trabajo que puso el problema sobre la mesa se titula Lost in the Middle, perdidos en medio, y lo firmaron Nelson Liu y sus coautores, la mayoría de la Universidad de Stanford, en julio de 2023. El experimento es de una sencillez admirable. Se toma una pregunta de un banco de preguntas reales hechas a un buscador, se busca el pasaje de la Wikipedia que contiene la respuesta y se le añaden otros pasajes relacionados con la pregunta que no la contienen. Luego se entrega todo al modelo y se le pide que responda, variando dos cosas: cuántos pasajes hay y en qué posición se coloca el bueno. Si el modelo leyera su contexto de manera uniforme, la posición daría igual.
La posición no da igual, y la forma de la curva es la misma en todos los modelos que probaron: una U. Con veinte pasajes, GPT-3.5-Turbo acertaba el 75,7 por ciento de las preguntas cuando el pasaje bueno era el primero, el 63,1 cuando era el último y el 54,1 cuando estaba en el décimo. La comparación que hace famoso al artículo es con la línea de puntos: ese mismo modelo, sin ningún pasaje, contestando solo con lo que recordaba de su entrenamiento, acertaba el 56,1 por ciento. Con la respuesta delante, en mitad de la entrada, lo hacía peor que sin ella. En el otro extremo, dándole solo el pasaje bueno, acertaba el 88,3. Toda la distancia entre esas dos cifras es información que estaba en el contexto y que el modelo no usó.
Los autores repitieron el experimento con una tarea que no deja margen a la interpretación: una lista de pares de claves y valores, cadenas aleatorias sin significado, y la petición de devolver el valor de una clave concreta. Algunos modelos la resolvían casi a la perfección en cualquier posición; otros mostraban la misma U. Y comprobaron que las versiones de los modelos con ventanas más largas no leían mejor lo que ya cabía en la corta, lo que desmontaba la idea, muy extendida entonces, de que una ventana mayor era simplemente un modelo mejor.
La U tiene un parecido llamativo con un fenómeno que la psicología conoce desde hace más de sesenta años. En 1962, Bennet Murdock pidió a sus participantes que recordaran listas de palabras en el orden que quisieran y dibujó la probabilidad de recordar cada palabra según su posición en la lista: las primeras y las últimas se recordaban mucho mejor que las del medio. Es el efecto de posición serial, con sus dos mitades, primacía y recencia. El parecido es solo eso, un parecido: los mecanismos no tienen por qué ser los mismos, y los investigadores de modelos de lenguaje proponen explicaciones propias, desde la forma en que se codifican las posiciones dentro del transformer hasta el hecho de que en los textos de entrenamiento lo importante suele estar al principio o al final. Pero es un recordatorio útil de que leer mucho y leer bien son cosas distintas también para las personas.
Dos años después, el problema no había desaparecido con los modelos nuevos, sino que había cambiado de forma. En julio de 2025, Kelly Hong, Anton Troynikov y Jeff Huber, de la empresa de bases de datos vectoriales Chroma, publicaron el estudio que dio nombre a la podredumbre del contexto. Probaron dieciocho modelos, entre ellos los más avanzados del momento de OpenAI, Anthropic, Google y Alibaba, y encontraron que el rendimiento empeoraba al alargar la entrada en todos ellos, incluso en tareas muy sencillas. Las pruebas de aguja en un pajar que los fabricantes solían publicar, con resultados casi perfectos, buscaban una frase que coincidía literalmente con la pregunta; cuando la aguja se parecía a la pregunta por el sentido y no por las palabras, o cuando había frases parecidas que distraían, la caída con la longitud era clara, y un solo distractor bastaba para notarla. El hallazgo más desconcertante fue que los modelos rendían mejor cuando el texto de relleno eran frases barajadas al azar que cuando era un texto coherente, lo que sugiere que la estructura de lo que se lee condiciona cómo se reparte la atención del modelo, y no siempre a favor.
La guía de Anthropic sobre lo que llama ingeniería de contexto, de septiembre de 2025, traduce todo esto a una metáfora de diseño: los modelos tienen un presupuesto de atención, y cada token que se añade al contexto gasta una parte. La justificación técnica es que en un transformer cada token se relaciona con todos los demás, de modo que con n tokens hay del orden de n² relaciones que el modelo tiene que ponderar, y la capacidad de ponderarlas bien no crece al mismo ritmo. La consecuencia práctica es que el objetivo ya no es meter en el contexto todo lo que podría ser útil, sino el conjunto más pequeño de tokens con más señal que permita hacer bien el paso siguiente.
Para un agente, eso se traduce en un puñado de prácticas que se han vuelto estándar. Lo que tiene que estar siempre presente, las instrucciones y las restricciones, va al principio, que es donde se lee mejor y donde además aprovecha la caché. Lo que se consulta no se precarga: el agente guarda referencias ligeras, rutas de ficheros, consultas, direcciones, y lee el contenido en el momento en que lo necesita, que es la misma idea que las herramientas bajo demanda. Lo que el agente produce y tendrá que recordar más adelante se escribe en un fichero de notas fuera del contexto. Y la lectura masiva se delega en subagentes que devuelven un resumen, o se hace desde un programa que filtra antes de que nada llegue al modelo. Cuando aun así la conversación se alarga, se compacta, con el riesgo que se explica en el bucle ReAct: el resumen es una lectura de la historia, no la historia.
Hay una lectura de todo esto que conviene evitar, y es la de que las ventanas largas no sirven. Sirven, y mucho: un modelo que puede tener delante un contrato entero o un repositorio mediano resuelve tareas que uno con ventana corta ni siquiera puede intentar. Lo que los datos dicen es otra cosa, más útil y más incómoda: que la cifra de tokens que anuncia un fabricante es la cantidad de texto que el modelo acepta, no la cantidad que usa bien, y que la segunda solo se conoce midiendo con las tareas y las longitudes propias. Un agente que funciona en las pruebas con conversaciones de diez mil tokens y se degrada en producción, donde llegan a ciento cincuenta mil, no tiene un fallo misterioso. Tiene exactamente el fallo que Liu y sus coautores dibujaron en 2023.
Fuentes
- Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni y Percy LiangLost in the Middle: How Language Models Use Long ContextsTransactions of the Association for Computational Linguistics 122024enlace
- Kelly Hong, Anton Troynikov y Jeff HuberContext Rot: How Increasing Input Tokens Impacts LLM PerformanceChroma Research2025enlace
- Prithvi Rajasekaran, Ethan Dixon, Carly Ryan y Jeremy HadfieldEffective context engineering for AI agentsAnthropic Engineering2025enlace
- Bennet B. MurdockThe serial position effect of free recallJournal of Experimental Psychology 64 (5)1962enlace