Una IA que escribe un plan de 8 pasos o más casi nunca lo ejecuta tal cual, según una prueba
Un agente de IA escribe un plan y lo ejecuta solo. En un estudio aún sin revisar por expertos, con tres modelos abiertos (no asistentes comerciales), solo entre el 12 y el 45 % de los planes se siguieron tal cual en tres de las cuatro pruebas. Y una comprobación barata antes de usarlo.

Un agente de IA escribe un plan de varios pasos y luego lo ejecuta. Un preprint publicado en arXiv el 29 de septiembre de 2026 mide cuántas veces lo ejecuta tal como lo escribió. (Un preprint es un estudio colgado en la web antes de que lo revisen expertos independientes.) Con planes de ocho pasos o más, en una de las pruebas, casi nunca ocurre. Lo firman cinco autores, entre ellos Francisco Herrera y Marcos López de Prado, y no ha pasado revisión por pares.
Qué se probó y cómo
Es como pedirle a un fontanero que anuncie los pasos de la reparación y mirar después si los hace. El equipo propone un esquema llamado Planning-as-Routing. El modelo declara uno de cuatro modos de planificar:
- Predefinido: plan completo de entrada, sin replanificar.
- Secuencial: paso a paso, ajustando según lo que ve.
- Jerárquico: un orquestador, como un jefe de obra, reparte subobjetivos.
- Búsqueda: varios planes candidatos que se ejecutan por separado y entre los que un juez elige.
Después se comparan dos formas de ejecutar. El ejecutor genérico Plan+ReAct da el plan al modelo y lo deja razonar y actuar a su aire. Los ejecutores específicos obligan a cada modo a respetar su estructura.
Las pruebas son cuatro baterías públicas, como exámenes que se pasan a todos los modelos: ALFWorld (134 tareas en un entorno simulado), Mind2Web (1.341 tareas de navegación web), SWE-bench Verified (500 tareas de ingeniería de software) y WebArena (204 tareas web). Los modelos son tres: Qwen3.6-35B-A3B, DeepSeek-V4-Flash y Gemma-4-26B. Un verificador automático da el plan por conservado solo si todos los pasos puntuables aparecen ejecutados y en el orden declarado.
Lo que salió
Con el ejecutor genérico, la estructura declarada sobrevivió en entre el 21,5 y el 27,4 % de las trayectorias de ALFWorld, según el modelo. En Mind2Web fue entre el 28,2 y el 44,6 %, y en SWE-bench entre el 12,1 y el 25,4 %. El resumen del artículo lo condensa en un intervalo de entre el 22 y el 45 % para tres de las pruebas.
La longitud del plan pesa mucho. En ALFWorld, los planes de cuatro o cinco pasos conservaron su estructura entre el 36,5 y el 49,6 % de las veces. Los de seis o siete, entre el 4,8 y el 21,4 %. Los de ocho o más, entre el 0 y el 1,2 %. Los planes jerárquicos fueron los más frágiles, típicamente por debajo del 25 %. WebArena sale mejor parada, aunque el texto del preprint (65,6 a 69,1 %) y su propia tabla (42,2 a 67,9 %) no cuadran del todo.
Dato clave
ALFWorld con DeepSeek-V4-Flash: el éxito por tarea pasa de 0,48 con el ejecutor genérico a 0,918 con el mejor patrón fijo (búsqueda). Con Qwen3.6-35B-A3B, de 0,54 a 0,796. En SWE-bench Verified, con DeepSeek, de 0,36 a 0,442. Fuente: preprint arXiv 2609.38108.
Un dato que se pierde en los resúmenes: darle un plan al modelo apenas ayuda por sí solo. En ALFWorld, con DeepSeek, el agente sin plan acierta el 0,44 de las tareas y con plan el 0,48.
Lo que el estudio no demuestra
Primero, el 0,918 es el resultado del mejor patrón fijo, elegido a posteriori, es decir, cuando ya se sabía cuál había salido mejor. Cuando es el propio modelo quien declara el modo y se ejecuta lo que declara, la cifra baja: 0,721 en ALFWorld con DeepSeek. Los autores concluyen que lo que el modelo declara no da una ventaja fiable tarea por tarea, más allá de sus preferencias generales. Darle ejemplos ya resueltos de qué patrón conviene a cada tarea (lo que se llama few-shot) mejora la elección, pero no la arregla.
Segundo, el modo de búsqueda recibe más presupuesto de ejecución, porque lanza varios intentos. Los autores lo controlan con reintentos y concluyen dos cosas. La ventaja de la búsqueda no se explica solo por repetir. Pero el techo teórico por tarea, el de un oráculo (un adivino que supiera de antemano qué patrón elegir), sí refleja sobre todo intentos adicionales. En ALFWorld, tres reintentos del patrón jerárquico superan al oráculo sin búsqueda en los tres modelos.
Tercero, en Mind2Web las tasas de éxito son minúsculas con cualquier método: con DeepSeek, de 0,038 a 0,057.
Cuarto, el verificador no es perfecto. Se contrastó con dos anotadores humanos sobre 100 trayectorias de ALFWorld, y el acuerdo fue modesto: un kappa de 0,31 y 0,34. (El kappa mide cuánto coinciden dos jueces más allá del azar: 0 sería puro azar y 1, acuerdo total.) Es parecido al que lograron los dos humanos entre sí (0,35). Y solo se probaron tres modelos: nada indica que un asistente comercial se comporte igual.
Por último, conservar el plan tampoco equivale a resolver la tarea: la calidad del plan y el éxito apenas guardan relación, con una correlación (r) de 0,181 como máximo, en una escala en la que 0 es ninguna relación y 1 es total.
Por qué importa
Los agentes se venden por encadenar pasos: leer un correo, consultar un pedido, actualizar una hoja, avisar a un cliente. Este trabajo sugiere que el eslabón débil puede estar en el sistema que ejecuta el plan y no solo en el modelo que lo redacta. Eso cambia lo que conviene pedir a un proveedor.
Otra fuente independiente, la descripción de un tutorial de la conferencia KDD 2026 con autores de Georgetown, Salesforce, Bloomberg, Bayer y Microsoft Research, enumera los mismos problemas en producción: alucinación (inventarse datos), bloqueos, deriva y errores en cascada, donde un fallo arrastra al siguiente. Propone verificación, mecanismos de respaldo y supervisión humana. Es un temario, no un estudio con datos, y se cita solo como contexto.
Para un emprendedor
Si usa o va a contratar un agente que toque facturas, correos a clientes o inventario, hay una prueba barata:
- Antes de ponerlo en marcha, ejecute la misma tarea unas diez veces con datos de prueba.
- Compare el plan que el agente anuncia con el registro de lo que hizo de verdad.
- Pida al proveedor que ese registro exista.
A mi juicio, y esto es una inferencia mía y no una conclusión del estudio, conviene partir las tareas largas en tramos cortos con una revisión humana entre ellos, porque es en los planes largos donde los datos muestran más desviación.
Fuentes
- arXiv, Do LLM Agents Execute the Plans They Declare? From Planning-Mode Declaration to Pattern-Specific Execution, preprint sin revisión por pares, 29 de septiembre de 2026. Versión HTML consultada: arxiv.org/html/2609.38108v1.
- arXiv, Agents in the Wild: Where Research Meets Deployment, descripción de tutorial para KDD 2026, 21 de julio de 2026.
Fuentes citadas
- arXiv (preprint, sin revisión por pares)Do LLM Agents Execute the Plans They Declare? From Planning-Mode Declaration to Pattern-Specific Execution (se abre en otra pestaña)
- arXiv (descripción de un tutorial de KDD 2026)Agents in the Wild: Where Research Meets Deployment (se abre en otra pestaña)



