Las herramientas bajo demanda

Cargar todas las herramientas al principio llena el contexto de un agente y lo confunde. Cómo lo resuelven la búsqueda de herramientas y las habilidades.

6 min
Editar

Las herramientas bajo demanda son la técnica por la que un agente de inteligencia artificial no recibe al empezar la descripción completa de todo lo que puede hacer, sino un índice breve, y lee la descripción de cada herramienta, o de cada procedimiento, solo cuando decide que la necesita. En el vocabulario del oficio se llama también divulgación progresiva (progressive disclosure), un término prestado del diseño de interfaces, donde designa la costumbre de mostrar al usuario primero lo esencial y dejar lo avanzado detrás de un clic. La razón de que se haya convertido en una pieza central de los agentes en 2025 es aritmética: con unas pocas decenas de herramientas conectadas, sus descripciones ya ocupan una parte considerable de la memoria de trabajo del modelo antes de que empiece la tarea.

Una herramienta, para un modelo de lenguaje, es un texto. Tiene un nombre, una descripción en lenguaje natural de qué hace y cuándo conviene usarla, y un esquema con sus parámetros, cada uno con su tipo y su propia descripción. El modelo lee todo eso para decidir si llama a la herramienta y con qué argumentos, y lo lee en cada paso del bucle, porque las definiciones van al principio de cada petición. Cuanto mejor está descrita una herramienta, más la entiende el modelo y más ocupa. Y desde que el protocolo MCP, presentado por Anthropic a finales de 2024, permitió conectar a un agente servidores de herramientas de cualquier proveedor con un par de líneas de configuración, lo normal dejó de ser tener cinco herramientas escritas a mano y pasó a ser tener cincuenta escritas por otros.

Interactivo Contexto que ocupan las definiciones de herramientas de cinco servidores MCP habituales, con las cifras que publicó Anthropic en noviembre de 2025: GitHub, 35 herramientas y unos 26.000 tokens; Slack, 11 y 21.000; Sentry y Grafana, 5 y 3.000 cada uno; Splunk, 2 y 2.000. En el modo bajo demanda el agente empieza con un buscador de herramientas y carga solo las que usa, estimadas con el tamaño medio de las disponibles.

La figura usa el ejemplo con el que Anthropic presentó en noviembre de 2025 su herramienta de búsqueda de herramientas. Cinco servidores corrientes en un equipo de desarrollo, el de GitHub, el de Slack y tres de monitorización, suman cincuenta y ocho herramientas y unos cincuenta y cinco mil tokens de definiciones. Añadir el servidor de Jira, el gestor de tareas más extendido, aporta por sí solo otros diecisiete mil. Con eso, más de la tercera parte de una ventana de doscientos mil tokens está ocupada por instrucciones de uso de herramientas que en una tarea concreta se usarán tres o cuatro. Y no es solo espacio. Como explica el artículo sobre la podredumbre del contexto, cada token de más reparte la atención del modelo entre más cosas, y un catálogo largo de herramientas parecidas, varias formas de buscar, varias de crear, con nombres casi idénticos de servidores distintos, es exactamente el tipo de distractor que más confunde.

La solución es la misma que usa cualquier biblioteca: un catálogo. El agente recibe al empezar una única herramienta de búsqueda, que ocupa unos quinientos tokens, y el resto de definiciones quedan marcadas para cargarse de forma diferida. Cuando el agente necesita, por ejemplo, abrir una incidencia, busca «crear incidencia», recibe las definiciones de las tres o cuatro herramientas que encajan y sigue con ellas. En el ejemplo de Anthropic, el consumo de contexto por las herramientas bajaba un 85 por ciento. Lo más interesante fue el efecto sobre el acierto: en las evaluaciones internas de la empresa con servidores MCP, el porcentaje de tareas en que el modelo elegía y usaba bien la herramienta pasaba del 49 al 74 por ciento con Claude Opus 4 y del 79,5 al 88,1 con Opus 4.5. Menos opciones a la vista, mejor elección.

La misma idea se aplica a algo más amplio que las herramientas, y ahí es donde el patrón resulta más novedoso. En octubre de 2025 Anthropic presentó las habilidades (Agent Skills): carpetas que contienen un fichero de instrucciones con un procedimiento, por ejemplo cómo preparar un informe con la plantilla de la empresa o cómo rellenar un formulario en PDF, y, si hace falta, programas y documentos de apoyo. La divulgación progresiva tiene aquí tres niveles. Al empezar, el agente solo ve el nombre y una frase de descripción de cada habilidad. Si decide que una es relevante para la tarea, lee su fichero de instrucciones. Y si esas instrucciones remiten a otros ficheros o programas, los lee o los ejecuta solo cuando llega a ese punto. Sus autores lo resumen señalando que un agente con acceso a un sistema de ficheros y a la ejecución de código no necesita leer una habilidad entera, de modo que la cantidad de conocimiento que se le puede empaquetar no tiene, en la práctica, un límite fijado por su ventana.

Es la misma estrategia que el código como acción aplica a los datos, aplicada ahora a las instrucciones: lo que el modelo no necesita leer, que no lo lea. El artículo de Anthropic sobre ejecución de código con MCP las une explícitamente, presentando las herramientas de cada servidor como ficheros de código en un directorio que el agente explora y abre cuando los necesita, en lugar de definiciones cargadas de antemano.

El patrón tiene un antecedente académico que ayuda a entender por qué funciona. En 2024, John Yang y sus coautores de Princeton presentaron SWE-agent, un agente de programación cuya principal aportación no era un modelo nuevo sino lo que llamaron una interfaz agente-ordenador. Era un conjunto pequeño de órdenes diseñadas pensando en cómo lee un modelo, que por ejemplo mostraban los ficheros de cien en cien líneas y no de golpe, devolvían mensajes de error concretos y avisaban de un fallo de sintaxis antes de guardar. Con esas herramientas el agente resolvía el 12,5 por ciento de las incidencias de SWE-bench, cuando el mejor resultado anterior sin agente rondaba el cuatro. La conclusión que sus autores sacaban, que los modelos son un nuevo tipo de usuario con necesidades propias y que la interfaz decide tanto como el modelo, es la que está debajo de la divulgación progresiva: mostrar menos y mejor.

El precio del patrón es una indirección. Cada búsqueda es un paso más del bucle, con su latencia, y un buscador que no encuentra la herramienta adecuada deja al agente sin ella aunque esté instalada; por eso Anthropic recomienda seguir cargando desde el principio las tres o cuatro herramientas que se usan casi siempre y dejar en diferido el resto. Y con las habilidades llega un riesgo de seguridad que conviene no olvidar: una habilidad son instrucciones y código que el agente va a seguir, así que instalar una de procedencia dudosa es darle a un desconocido la capacidad de escribir en las instrucciones del agente. La propia guía de Anthropic recomienda instalar solo habilidades de fuentes de confianza y revisar a fondo cualquier otra, en particular sus dependencias y cualquier instrucción que dirija al agente hacia redes externas, que es la forma exacta en que una de ellas podría completar la trifecta letal.

§

Fuentes

  1. Bin Wu y otrosIntroducing advanced tool use on the Claude Developer PlatformAnthropic Engineering2025enlace
  2. Barry Zhang, Keith Lazuka y Mahesh MuragEquipping agents for the real world with Agent SkillsAnthropic Engineering2025enlace
  3. Adam Jones y Conor KellyCode execution with MCP: building more efficient AI agentsAnthropic Engineering2025enlace
  4. John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan y Ofir PressSWE-agent: Agent-Computer Interfaces Enable Automated Software EngineeringAdvances in Neural Information Processing Systems 372024enlace
Sarasola, Josemari (2026). "Las herramientas bajo demanda". Ikusmira. Recuperado de https://ikusmira.org/p/las-herramientas-bajo-demanda/

Una errata, un dato desfasado, un párrafo que falta: edítalo y la redacción revisa tu propuesta.

Sugerir una mejora →