Why can I not reproduce the exact output my model gave in production?
Opportunité
Even at temperature zero, the same prompt sent to the same model twice can return different tokens. A January 2026 arXiv paper traced the root cause to dynamic batching: GPU reduction kernels change their internal arithmetic tree when batch size changes, and floating-point addition is not associative, so two requests processed under different batch sizes take different numerical paths and diverge. Serving infrastructure has no obligation to record or expose the batch context that produced a given output. This makes it impossible to replay a failed inference, write a regression test that pins exact behavior, or reconstruct what a model actually said during a production incident. The only solution demonstrated so far imposes a 61 percent throughput cost.
Pourquoi c'est important
Deterministic replay is the minimum bar for treating a model call as an auditable computation rather than a black box you trust but cannot inspect.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?