Si has seguido la evolución de los agentes de inteligencia artificial, probablemente te has encontrado con palabras como harness, scaffold, política o rollout. El problema es que no siempre significan lo mismo según la herramienta o el equipo que las use. Hugging Face publicó un glosario técnico para ordenar estas ideas y explicar cómo se conectan en un sistema basado en agentes.
La necesidad de aclararlo surgió después de ICLR 2026, cuando varios profesionales reconocieron que escuchaban hablar de harness y scaffold sin encontrar una definición común. ¿Por qué importa tanto esta diferencia? Porque dos productos pueden utilizar el mismo modelo y ofrecer experiencias completamente distintas debido a la forma en que lo rodean y lo hacen actuar.
El modelo no es el agente completo
El modelo es el lenguaje que genera respuestas. Claude, Qwen, GPT, Kimi y DeepSeek son ejemplos de modelos que reciben texto y producen texto. Por sí solos, no tienen memoria entre llamadas, no mantienen un ciclo de ejecución y tampoco pueden abrir un archivo o consultar una API.
Un modelo puede expresar la intención de ejecutar una herramienta, pero necesita otro sistema que interprete esa intención y la lleve a cabo. Si responde una vez y se detiene, todavía no estamos ante un agente autónomo.
Un agente de IA no es únicamente el modelo. Es el modelo más las instrucciones, las herramientas y el sistema que coordina sus acciones.
Scaffold y harness: dos capas que suelen confundirse
El scaffold, que puede traducirse como estructura de soporte, es todo lo que define el comportamiento del modelo. Incluye elementos como:
- El system prompt o instrucciones principales.
- Las descripciones de las herramientas disponibles.
- El formato que debe seguir la respuesta.
- La memoria y el historial que recibe en cada paso.
- La forma en que se organiza la información dentro del contexto.
El scaffold determina qué ve el modelo y bajo qué reglas trabaja. Es parecido al guion, el manual y el espacio de trabajo que recibe una persona antes de comenzar una tarea.
El harness es la capa de ejecución. Se encarga de llamar al modelo, recibir sus solicitudes de herramientas, ejecutarlas, devolver los resultados al contexto y decidir cuándo termina el proceso. En términos simples, el scaffold prepara al modelo y el harness hace que el agente funcione.
La distinción no siempre se usa de forma estricta. Productos como Claude Code y Codex pueden llamar harness al sistema completo que rodea al modelo. En otros contextos, el término también incluye configuraciones del entorno, hooks, archivos y otra infraestructura.
Qué convierte a un modelo en un agente
Un agente combina el modelo con un ciclo de observación, decisión y acción. El modelo recibe información, propone una acción, el sistema ejecuta esa acción y el resultado vuelve al contexto. El proceso se repite hasta completar la tarea o alcanzar una condición de parada.
Imagina un agente para programación. El modelo puede decidir que necesita revisar un archivo. El harness interpreta la llamada, ejecuta una herramienta del sistema de archivos, obtiene el contenido y se lo presenta de nuevo al modelo. Después, el agente puede editar el código, ejecutar pruebas y corregir errores.
Por eso suele resumirse la idea de esta manera:
Agente = Modelo + Harness
Sin embargo, el scaffold sigue siendo importante porque determina la calidad de las instrucciones, las herramientas y el contexto que recibe el modelo. Un harness bien diseñado también debe controlar errores, establecer límites, gestionar permisos y saber cuándo detenerse.
El mismo modelo puede producir experiencias diferentes
Cuando utilizas Claude Code, Codex, Cursor o una herramienta similar, no estás interactuando solamente con un modelo. Estás usando un producto compuesto por un modelo, un harness y decisiones de diseño específicas.
Dos productos pueden usar el mismo modelo y comportarse de manera muy distinta. Uno puede ofrecer mejores herramientas para navegar un repositorio, mientras otro puede administrar mejor la memoria o manejar con más cuidado las acciones peligrosas.
También ocurre lo contrario: si sustituyes el modelo dentro del mismo harness, cambia la experiencia. Puede mejorar la calidad del razonamiento, aumentar la velocidad o fallar al interpretar ciertos formatos. Modelo, harness y producto son conceptos relacionados, pero no equivalentes.
Context engineering: decidir qué ve el agente
La ingeniería de contexto, conocida como context engineering, consiste en diseñar la información que llega al modelo en cada paso. No se trata solo de escribir un buen prompt. También implica decidir cómo se incorporan:
- Las instrucciones del sistema.
- El historial de conversación.
- Los resultados de las herramientas.
- La información recuperada de documentos.
- Las reglas de seguridad y los ejemplos.
El contexto cambia durante la ejecución. Cada respuesta y cada llamada a una herramienta pueden modificar lo que el modelo recibe después. Si se incluye demasiada información, el modelo puede perder señales importantes. Si se incluye muy poca, tendrá dificultades para actuar correctamente.
La memoria forma parte de este problema. La memoria de corto plazo vive dentro de una ejecución, con mensajes, resultados y pasos anteriores. La memoria de largo plazo se guarda fuera del modelo y se recupera cuando resulta relevante para una nueva sesión.
Política, herramientas, habilidades y subagentes
En aprendizaje por refuerzo, una política define la probabilidad de elegir una acción ante una situación. En los sistemas de lenguaje, parte de esa política está en los pesos del modelo, pero también depende de sus instrucciones, herramientas, memoria y ciclo de ejecución.
La política no es el agente. La política define cómo se comporta, mientras que el agente es el sistema completo que actúa en un entorno.
Las herramientas permiten que el agente salga del texto y afecte el mundo exterior. Pueden ser una API, un buscador web, un intérprete de código, una base de datos o un sistema de archivos. El modelo solicita una acción en un formato estructurado, el harness la ejecuta y el resultado vuelve al contexto.
Una habilidad, o skill, agrupa conocimiento y procedimientos para completar una tarea de varios pasos. Una herramienta sería "ejecutar este comando". Una habilidad sería "investigar este error, plantear una hipótesis y preparar una solución". La frontera entre herramientas, habilidades y subagentes puede cambiar según el framework.
Un subagente es otro agente al que se delega una tarea específica. Tiene su propio modelo, scaffold y herramientas, y devuelve un resultado al agente principal. La diferencia es importante: una herramienta ejecuta una función, una habilidad empaqueta conocimiento y un subagente puede razonar, usar herramientas y delegar más trabajo.
Los términos que aparecen durante el entrenamiento
Hugging Face también separa varios conceptos propios del entrenamiento de agentes. En este escenario, el sistema ejecuta tareas, recibe una puntuación y actualiza los pesos del modelo.
El entorno es todo aquello con lo que el agente puede interactuar. Un sistema de archivos es un ejemplo sencillo: una acción como touch foo.txt modifica el estado y la nueva lista de archivos se convierte en una observación.
El trainer coordina los episodios, calcula las puntuaciones y actualiza el modelo. Una implementación como GRPOTrainer de TRL reúne estas responsabilidades en un flujo de entrenamiento basado en resultados.
Un rollout, también llamado trayectoria o traza, es una ejecución completa del agente. Registra lo que observó, las acciones que tomó y la recompensa obtenida en cada paso. Es uno de los datos principales que utilizan los algoritmos de aprendizaje por refuerzo.
La recompensa indica si el agente está mejorando. Puede ser verificable, como comprobar si pasan unas pruebas; aprendida, como una preferencia humana o una evaluación hecha por otro modelo; escasa, con una sola puntuación al final; o densa, con una puntuación en cada paso.
Las rúbricas descomponen esa recompensa en dimensiones concretas. Por ejemplo, una evaluación puede valorar por separado la corrección, la seguridad y el uso eficiente de herramientas, asignando un peso a cada criterio.
Por qué este vocabulario resulta útil
Estos términos todavía no tienen definiciones universales. Un framework puede usar harness para describir todo el sistema, mientras otro lo reserva para el bucle de ejecución. La intención del glosario no es imponer una única forma de hablar, sino ofrecer un mapa mental común.
La diferencia ayuda a diagnosticar problemas. Si un agente responde mal, quizá el modelo no tenga la capacidad necesaria. Pero también puede fallar el scaffold por entregar instrucciones confusas, el harness por manejar mal una herramienta o el contexto por saturarse con información irrelevante.
Entender estas capas permite analizar los agentes con más precisión y menos misterio. La inteligencia no está únicamente en los pesos del modelo: también está en la arquitectura que decide qué puede ver, qué puede hacer y cómo aprende de cada resultado.
