Pourquoi ne puis-je pas rejouer exactement ce que mon agent a fait lorsqu'il a échoué en production ?
Opportunité
Un agent LLM qui échoue en production ne peut pas être reproduit de manière fiable pour le débogage, car réexécuter le même prompt produit des sorties différentes. La plupart des frameworks d'agents journalisent les entrées et les sorties finales mais rejettent la trace d'exécution complète, ce qui signifie que chaque appel d'outil intermédiaire, chaque réponse du modèle et chaque mutation d'état disparaît dès la fin de l'exécution. Sans lignage d'exécution, une exécution échouée est un trou noir forensique et les ingénieurs reconstruisent les défaillances à partir des symptômes plutôt que des causes. Un article de mai 2026 propose des graphes d'exécution déterministes comme premier primitif pour cela, mais note que capturer et rejouer des traces non déterministes à l'échelle de la production sans surcharge prohibitive reste un problème d'ingénierie ouvert. Une étude de cas distincte de 2026 sur les défaillances agentiques dans des workflows scientifiques a constaté que des étapes intermédiaires plausibles mais incorrectes se propageaient silencieusement dans les pipelines précisément parce qu'aucune re
Pourquoi c'est important
Le débogage reproductible est le primitif minimum viable pour opérer des agents IA en production avec quelque confiance que ce soit.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?