Comment prouver qu'un modèle a été entraîné sur des données consenties sans révéler le jeu de données ?
Opportunité
Les réseaux d'IA décentralisés permettent à quiconque de contribuer en calcul ou en données pour entraîner un modèle partagé, mais il n'existe aucun mécanisme permettant à un utilisateur en aval ou à un régulateur de vérifier que le corpus d'entraînement exclut des données empoisonnées, volées ou non consenties sans que le réseau ne révèle ce sur quoi il a été entraîné. La provenance des données repose aujourd'hui soit sur un manifeste signé que les contributeurs auto-attestent, soit sur un audit centralisé qui va à l'encontre du but de la décentralisation. Un article de février 2025 sur les attaques par inversion d'activation a montré que les données d'entraînement peuvent être partiellement reconstituées à partir des signaux de gradient échangés lors de l'entraînement fédéré, ce qui signifie que tout schéma de provenance nécessitant le partage de gradients divulgue également des données. Le top dix OWASP LLM 2025 liste explicitement l'empoisonnement des données de la chaîne d'approvisionnement comme une catégorie sans mitigation standardisée pour les exécutions d'entraînement ouvertes et décentralisées.
Pourquoi c'est important
Sans provenance de données vérifiable, tout modèle entraîné sur un réseau décentralisé public représente un risque pour toute application en aval soumise à un contrôle réglementaire ou de droits d'auteur.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
À quoi ressemble vraiment le compte bancaire d'un agent IA ?
AI x CryptoUne organisation on-chain gérée par des agents peut-elle éviter de devenir une machine à arnaques ?
AI x CryptoComment prouver qu'une photo ou une voix est authentique sans qu'une plateforme s'en porte garante ?
AI x CryptoPourquoi l'identité on-chain est-elle soit inexistante soit toute votre vie ?
AI x CryptoComment auditer quel agent a agi sous mon identité dans une chaîne de délégation ?
AI x CryptoComment vérifier qu'un agent IA détenant mes fonds est réellement solvable ?