Pourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
Opportunité
Les équipes choisissent un modèle dans un classement, puis l'exécutent en production avec presque aucune évaluation continue, abordable et spécifique à la tâche. Quand la qualité dérive, personne ne s'en aperçoit jusqu'à ce qu'un utilisateur se plaigne. Les outils permettant de mesurer réellement si votre fonctionnalité IA est encore performante manquent à la plupart des développeurs.
Pourquoi c'est important
On ne peut pas exploiter ce qu'on ne peut pas mesurer, et à l'heure actuelle la plupart des fonctionnalités IA ne sont pas mesurées.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?
AIPourquoi les données d'entraînement ne comportent-elles aucun enregistrement lisible par machine indiquant si quelqu'un a consenti ?