Replay determinista para agentes de IA: convertir "falló" en "esto es exactamente por qué"

"Falló" no es un diagnóstico

Cuando un agente de IA se comporta mal en producción, el primer aviso siempre es el mismo: falló. Aprobó la factura equivocada, escribió al cliente equivocado, entró en un bucle infinito. El aviso nombra un síntoma. Lo caro es que la mayoría de los sistemas no pueden decirte por qué, porque las condiciones exactas, la versión del modelo, el prompt, las respuestas de las herramientas, el estado intermedio, desaparecen en cuanto termina la ejecución. Te quedas volviendo a lanzar el agente con la esperanza de que se rompa igual, cosa que normalmente no ocurre.

Determinismo mediante event sourcing

El replay determinista toma una idea bien conocida del event sourcing: en lugar de guardar solo el estado final, guardas la secuencia ordenada de eventos que lo produjo. Para un agente de IA eso significa capturar cada entrada, cada llamada al modelo y su respuesta, cada invocación de herramienta y su resultado, y cada decisión, como eventos inmutables. Con el mismo registro de eventos puedes reproducir la ejecución y llegar exactamente al mismo punto, no a uno parecido, al mismo.

Por qué el no-determinismo es un problema de registro, no de modelo

Se suele asumir que no puedes reproducir un agente LLM porque el modelo es estocástico. Pero la aleatoriedad vive en un conjunto acotado de lugares: el muestreo en la llamada al modelo, las respuestas de herramientas externas, las marcas de tiempo, las semillas aleatorias. Si registras esas salidas en el momento en que ocurren y reproduces desde el registro en vez de volver a llamar a los servicios en vivo, la ejecución se vuelve determinista. No le pides al modelo que sea repetible, reproduces la grabación de lo que ya hizo.

De "esto es más o menos lo que pasó" a "esto es exactamente por qué"

Con un registro de eventos completo, depurar cambia de naturaleza. En vez de adivinar, cargas la ejecución fallida y la recorres paso a paso: aquí está la entrada, aquí la respuesta del modelo, aquí donde la herramienta devolvió un valor inesperado, aquí la rama que tomó el agente por ello. La causa raíz deja de ser una hipótesis y pasa a ser una línea que puedes señalar. Eso es también lo que convierte un incidente en evidencia que puedes mostrar a un regulador o a un cliente.

El coste de ingeniería es sobre todo disciplina

Lo difícil no es una infraestructura ingeniosa, es la disciplina. Toda fuente de no-determinismo debe pasar por una frontera que registre su salida, y el estado nunca debe mutarse en su sitio: se deriva plegando el registro de eventos. Los equipos que lo adoptan pronto obtienen el replay casi gratis. Los que lo añaden después de un incidente pasan meses instrumentando un sistema que nunca se diseñó para recordarse a sí mismo.

Take-away

Registra cada fuente de no-determinismo en su frontera y deriva el estado plegando el registro de eventos. Entonces cualquier ejecución fallida se reproduce exacta, y la causa raíz pasa de hipótesis a una línea que puedes señalar.