Los agentes ya no se limitan a una sucesión de tres llamadas. Pueden inspeccionar archivos, ejecutar comandos, usar un navegador, modificar un proyecto y trabajar en una tarea durante un período prolongado. En abril de 2026, OpenAI presentó, en particular, una evolución de su SDK de Agentes que incluye entornos sandbox controlados y una separación más clara entre el arnés y la computación.
Esta autonomía aumenta el valor, pero también el impacto de un error. Un agente puede repetir una acción incorrecta, seguir una instrucción malintencionada contenida en un archivo o continuar una estrategia costosa durante horas. Por lo tanto, la fiabilidad debe ser diseñada a nivel de la plataforma.
Los SDK, modelos y primitivas de sandbox evolucionan rápidamente. Verifique las versiones y condiciones al momento de la implementación.
El modelo no constituye al agente
Un sistema agentico comprende:
- un modelo ;
- un arnés que gestiona el bucle;
- instrucciones;
- herramientas;
- una política;
- un entorno de ejecución;
- un estado;
- una memoria;
- aprobaciones;
- de la observabilidad;
- un mecanismo de parada.
La calidad del modelo importa, pero el arnés determina cómo planifica, interpreta un resultado, reintenta, compacta el contexto y termina.
Un modelo más capaz en un entorno demasiado permisivo a veces aumenta el riesgo más rápido que la productividad.
Definir una unidad de trabajo
Una tarea larga debe estar limitada por un contrato:
- objetivo;
- entrada ;
- artefactos esperados;
- criterios de aceptación;
- prohibiciones;
- presupuesto ;
- duración;
- propietario;
- estado final;
- procedimiento de escalada.
Evitar los objetivos abiertos como «mejorar el proyecto». Preferir «corregir estos tres escenarios, agregar las pruebas y producir una pull request sin modificar el esquema de datos».
El agente debe poder declarar que está bloqueado o que los criterios son contradictorios.
Separar el arnés del cómputo
El arnés orquesta la conversación, las herramientas, la política y el estado. El cálculo ejecuta los comandos en una sandbox: contenedor, VM, navegador aislado o entorno especializado.
Esta separación permite:
- de reemplazar el cómputo;
- de limitar recursos y red;
- de destruir el medio ambiente;
- de conservar el estado útil en otro lugar;
- de paralelizar ;
- de reanudar después de una avería;
- auditar las acciones.
El sandbox es efímero por defecto. Los artefactos explícitamente seleccionados se copian en un almacenamiento duradero después de la verificación.
Arquitectura separando el agente de harness, el modelo, la política, el cómputo en sandbox, las herramientas, secretos, puntos de control y la supervisión.
Aplicar el menor privilegio a las herramientas
Cada tarea recibe una lista de capacidades, no los derechos completos del usuario. Las herramientas están clasificadas:
- lectura local;
- lectura externa;
- propuesta ;
- escritura reversible;
- acción irreversible o de gran impacto.
Leer un depósito no autoriza a publicar. Preparar un correo electrónico no autoriza a enviarlo. Generar una migración no autoriza a ejecutarla en producción.
Los permisos son temporales, limitados a un recurso y revocables. Una herramienta no declarada es inaccesible.
Controlar la red
El acceso completo a Internet rara vez es necesario. Prever:
- ninguna red;
- lista de permitidos de dominios;
- proxy registrado;
- descargas limitadas;
- subida prohibida;
- inspección de tipos y tamaños;
- resolución DNS controlada.
El contenido descargado no es fiable. Se analiza en un espacio separado y no puede modificar las instrucciones del sistema.
El escenario más peligroso combina una fuente externa maliciosa, un secreto, una herramienta de escritura y una red saliente. La política debe impedir esta composición.
Proporcionar los secretos a demanda
Un secreto nunca está inscrito en el prompt ni en la imagen del sandbox. Un bróker emite un token corto, limitado a la acción, con una audiencia y una duración.
El diario indica que se produjo un acceso sin registrar el valor. Los secretos son revocables y renovables. Cuando es posible, la herramienta realiza la operación en nombre del agente sin entregarle el secreto en bruto.
Un agente no obtiene credenciales de producción para preparar un informe.
Presupuestar la autonomía
Una tarea larga posee varios presupuestos:
- tiempo ;
- etapas;
- fichas ;
- llamadas modelo ;
- costo;
- CPU ;
- memoria ;
- almacenamiento ;
- red ;
- errores y reintentos.
Al acercarse a un límite, el agente resume su estado, guarda los artefactos y solicita una decisión. No continúa automáticamente con un gasto superior.
Los reintentos utilizan retroceso y idempotencia. Un error permanente no se repite cien veces.
Guardar puntos de control útiles
El contexto del modelo no es un almacenamiento duradero. Un checkpoint contiene:
- objetivo y restricciones;
- plano corriente;
- etapas completadas;
- decisiones;
- archivos modificados;
- resultados de pruebas;
- errores;
- próxima acción;
- presupuesto restante;
- versión de las herramientas y del modelo.
El punto de control es atómico y versionado. La reanudación verifica que el entorno no haya cambiado. Si una acción pudo haber tenido éxito antes de la falla, una clave de idempotencia o una lectura de estado evita la duplicación.
Compactar la memoria sin borrar las restricciones
En una tarea larga, el contexto debe resumirse. Una mala compactación puede perder una prohibición o una decisión.
Separar:
- instrucciones inmutables;
- hechos verificados;
- decisiones;
- histórico comprimible ;
- artefactos externos ;
- resultados de herramientas.
El resumen está estructurado y controlado. Las restricciones de seguridad nunca están presentes únicamente en un texto producido por el modelo.
Detectar los bucles y la deriva
Las señales son:
- mismos comandos;
- mismos errores;
- archivos modificados y luego cancelados;
- ausencia de progreso;
- plano que se amplía;
- multiplicación de herramientas;
- coste sin artefacto;
- criterios de aceptación ignorados.
El arnés calcula indicadores de progreso y se detiene después de un número de ciclos. El agente produce un diagnóstico y solicita ayuda.
Introducir aprobaciones en los lugares correctos
Solicitar una confirmación en cada lectura hace que el sistema sea inutilizable. Nunca solicitarla antes de una acción crítica es peligroso.
Las puertas típicas:
- acceso a un nuevo dato sensible;
- adición de un dominio de red;
- uso de un secreto;
- escritura externa ;
- envío ;
- publicación ;
- gasto;
- eliminación;
- cambio de permisos ;
- pasaje en producción.
La pantalla de aprobación explica la acción, el objetivo, los datos, el riesgo, la alternativa y la posibilidad de cancelar.
Producir artefactos verificables
El resultado no debe ser únicamente una frase « tarea completada ». Incluye:
- archivos ;
- diferencia ;
- informe ;
- fuentes ;
- pruebas ;
- troncos sintéticos;
- decisiones;
- límites ;
- elementos no terminados.
Los artefactos pasan controles de malware, secreto, formato y tamaño antes de salir del sandbox.
Observar sin grabar todo
Las huellas sirven para comprender los errores, pero pueden contener datos. Separar:
- métricas;
- eventos de herramientas;
- decisiones;
- solicitudes enmascaradas;
- contenidos sensibles;
- artefactos.
La retención depende del riesgo. Los equipos disponen de un cuadro que muestra tareas activas, presupuestos, bloqueos, errores, aprobaciones y kill switch.
Probar los comportamientos adversos
Los escenarios obligatorios incluyen:
- instrucción maliciosa en un documento;
- enlace a un dominio no autorizado;
- intento de exfiltración;
- orden destructiva;
- secreto mostrado por error;
- bucle ;
- falso éxito;
- fallo en medio de una escritura;
- reanudación con versión diferente;
- herramienta no disponible;
- excedente de presupuesto.
La prueba verifica el sistema completo, no solo la respuesta del modelo.
Diseñar el interruptor de emergencia y la revocación
El operador debe poder:
- suspender una tarea;
- cortar la red;
- revocar los tokens;
- congelar los artefactos;
- detener una clase de tareas;
- volver a una versión;
- impedir las nuevas ejecuciones.
El procedimiento está probado. Un botón no conectado al ordenador no constituye una parada.
Elegir las tareas adecuadas
Los mejores primeros casos son limitados, verificables y reversibles: análisis documental, preparación de pruebas, informe con fuentes, transformación de archivos o propuesta de modificación.
Evitar primero las acciones financieras, decisiones sobre personas, administración global o publicación autónoma.
Partitech puede construir el harness, los sandboxes, la pasarela de herramientas, las políticas, los checkpoints y la observabilidad. El objetivo no es un agente que «puede hacerlo todo», sino una plataforma capaz de demostrar lo que ha hecho, de limitar lo que puede hacer y de reanudar correctamente cuando falla.
Hablemos de su proyecto
Diseñar y asegurar una plataforma de agentes de larga duración con Partitech. Contacte a Partitech.