Que una IA lidere un ranking no significa que sea la mejor para ti, según un estudio
Un agente de IA decide solo qué pasos dar para cumplir un encargo. Un estudio aún sin revisar por expertos (29.923 pruebas con 54 modelos) concluye que su puesto en un ranking depende en buena parte del software que lo rodea. Y una prueba casera dice lo que el ranking no.

Un agente de IA es un sistema en el que un modelo de lenguaje decide por su cuenta qué pasos dar y qué herramientas usar para cumplir un encargo. Es, en esencia, la definición que Anthropic publicó en diciembre de 2024. Sirve para entender un preprint del 30 de septiembre de 2026, un estudio colgado en arXiv antes de que lo revise ningún experto. Sus autores muestran que el puesto de un modelo en una clasificación de agentes depende en buena parte de lo que lo rodea, y no solo del modelo.
Qué es un agente y qué no
Anthropic separa dos cosas. Un flujo de trabajo (workflow) es un recorrido fijo, programado de antemano, en el que el modelo ocupa algunos pasos: recibir un correo, resumirlo, guardarlo en una hoja. En un agente, el modelo se encarga de «dynamically direct their own processes and tool usage», es decir, de dirigir de forma dinámica sus propios procesos y el uso de herramientas. Se le da el objetivo, no la receta. Es como encargar a un empleado que deje cobrada la factura de un cliente sin explicarle cómo.
Por dentro suele ser un bucle. El modelo recibe el objetivo y elige una acción: buscar, abrir un archivo, escribir en una hoja de cálculo. El sistema la ejecuta y le devuelve el resultado. Con eso, el modelo decide qué viene después, hasta dar la tarea por cumplida o agotar un límite. Lo central es que el camino no está escrito de antemano.
Anthropic es prudente. Su guía recomienda empezar por lo más simple, porque muchas veces basta con optimizar una sola llamada al modelo, y advierte de que los agentes cuestan más, tardan más y pueden acumular errores.
El andamiaje que no se ve
El preprint usa la palabra scaffold, que en español sería andamiaje o arnés. Según los autores, es el software que rodea al modelo y le permite actuar: guarda el estado de la tarea, pone las herramientas a su alcance y convierte lo que escribe el modelo en acciones reales. Sería como un mecánico: el modelo es su cabeza y el andamiaje, el taller con sus herramientas. Modelo y andamiaje juntos forman el sistema que se evalúa.
Ese andamiaje también se vende. En su evento para desarrolladores del 29 de septiembre, OpenAI presentó el uso de ordenador en su Agents API, con el que una aplicación maneja un programa a través de su pantalla, como lo haría una persona. Según InfoQ, además es OpenAI quien gestiona la infraestructura de ejecución. Quien contrata eso no compra solo un modelo.
Por qué los pasos se acumulan
Un ejemplo de cuenta propia, con un supuesto simplificado. Si un agente acierta el 95 % de las veces en cada paso y los pasos son independientes entre sí, una tarea de diez pasos sale bien en torno al 60 % de las veces (0,95 elevado a 10 da 0,599). Es como un repartidor que casi nunca falla una entrega: con rutas de diez paradas, aun así, unas cuatro de cada diez tendrían algún fallo. Un acierto alto por paso no garantiza un acierto alto en el conjunto.
Un estudio aceptado en la conferencia ICML 2026, de Stephan Rabanser, Sayash Kapoor, Arvind Narayanan y otros, lo plantea desde otro lado. Propone medir los agentes con doce métricas en cuatro dimensiones: consistencia, robustez, previsibilidad y seguridad. Tras evaluar 15 modelos, concluye que las mejoras recientes en capacidad solo han traído mejoras pequeñas en fiabilidad.
Qué encontró el preprint de septiembre
El trabajo de Michael Hardy, Ruhana Azam, Anka Reuel, Mykel Kochenderfer y Sanmi Koyejo se envió el 30 de septiembre. Es un preprint: no ha pasado revisión por pares. Parte de nueve pruebas del Holistic Agent Leaderboard, una clasificación pública de agentes: 29.923 ejecuciones de 54 modelos con 13 andamiajes.
Mide dos tipos de fiabilidad, en una escala de 0 a 1. Un valor alto significa que el orden de la clasificación se repetiría si se volviera a hacer la prueba:
- El ranking de sistemas completos, es decir, de parejas de modelo y andamiaje, es muy estable: entre 0,935 y 0,994.
- El ranking de los modelos por sí solos, una vez promediado el efecto del andamiaje, lo es mucho menos: entre 0,148 y 0,841.
Dicho de otro modo: es fácil saber qué combinación concreta puntúa más, y bastante más difícil saber si un modelo es mejor que otro con independencia de cómo se le prepare. Según los autores, cambiar de andamiaje puede alterar qué modelo parece superior. Esa fiabilidad entre andamiajes va de 0,151 en Online-Mind2Web a 0,852 en CORE-Bench Hard.
Otro resultado va contra el reflejo habitual: añadir más tareas parecidas no arregla el problema. Con infinitas tareas del mismo tipo, la fiabilidad del ranking de modelos mejoraría como máximo 0,097 si la incertidumbre viene de probar pocos andamiajes. Repartir el presupuesto entre pruebas distintas sí ayuda: con el mismo gasto, la fiabilidad proyectada pasa de 0,44 a 0,75, y el coste podría bajar hasta un 83 % (8.144 dólares frente a 47.000, en su cálculo).
Los propios autores matizan que la fiabilidad es necesaria pero no suficiente para que una evaluación sea válida, y no analizan si los resultados se trasladan a usos reales.
Por qué importa
Cuando un proveedor presume de que su agente logra un porcentaje alto en una prueba pública, esa cifra mide una pareja concreta de modelo y andamiaje, en tareas concretas, y quizá en una sola pasada. A mi juicio, la conclusión más útil del preprint es práctica: antes de fiarse de una clasificación, hay que saber con qué arnés se obtuvo y si el resultado se repite.
Para un emprendedor
Antes de poner un agente a trabajar en el negocio, una prueba casera de unos días enseña lo que las clasificaciones no cuentan:
- Elegir una tarea con resultado verificable, como clasificar facturas o responder consultas frecuentes.
- Preparar 20 casos reales con la respuesta correcta anotada de antemano.
- Pasar cada caso varias veces. Contar los aciertos y también cuántas veces cambia el resultado con la misma entrada, que es lo que mide la dimensión de consistencia.
- Decidir por escrito qué acciones necesitan aprobación humana, como enviar un mensaje a un cliente o gastar dinero.
- Comparar con un flujo fijo más sencillo, porque la propia guía de Anthropic recomienda empezar por la solución más simple.
Fuentes
- Hardy, Azam, Reuel, Kochenderfer y Koyejo, Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard, arXiv, 30 de septiembre de 2026 (preprint): https://arxiv.org/abs/2610.00651
- Rabanser, Kapoor, Kirgis, Liu, Utpala y Narayanan, Towards a Science of AI Agent Reliability, arXiv, 18 de febrero de 2026, aceptado en ICML 2026: https://arxiv.org/abs/2602.16666
- Anthropic, Building Effective AI Agents, 19 de diciembre de 2024: https://www.anthropic.com/engineering/building-effective-agents
- InfoQ, OpenAI DevDay 2026 Recap for Developers, 2 de octubre de 2026: https://www.infoq.com/news/2026/10/openai-devday-2026/
Fuentes citadas
- arXiv (preprint)Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard (se abre en otra pestaña)
- arXiv (aceptado en ICML 2026)Towards a Science of AI Agent Reliability (se abre en otra pestaña)
- AnthropicBuilding Effective AI Agents (se abre en otra pestaña)
- InfoQOpenAI DevDay 2026 Recap for Developers (se abre en otra pestaña)



