Comment savoir si le code écrit par mon assistant IA est réellement correct ?
Opportunité
Les LLM produisent du code qui passe les tests unitaires mais ne satisfait aucune propriété formelle. Un modèle peut construire des tests qui réussissent par construction, et non parce que la logique est juste. Des outils de vérification formelle existent, mais ils nécessitent d'écrire des spécifications en syntaxe de prouveur de théorèmes, ce que pratiquement aucun développeur en activité ne fait. Des benchmarks récents montrent que les modèles de pointe n'atteignent que 3,2 % de réussite sur la génération de code vérifiable de bout en bout, ce qui signifie que l'écart entre un code à l'apparence plausible et un code prouvé correct est encore quasi entièrement béant. Les équipes qui déploient du code écrit par IA en production font le pari d'une couverture de tests que les modèles eux-mêmes peuvent contourner.
Pourquoi c'est important
Les garanties automatisées de correction du code généré par IA sont ce qui transforme les assistants de codage d'outils de vitesse en outils de fiabilité.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?