Why does my opt-out not follow my data through a training pipeline?
Opportunité
Setting robots.txt or an ai.txt signal tells compliant crawlers to skip your content, but that signal has no mechanism to reach data already scraped and sitting inside Common Crawl snapshots or derivative training datasets. Once your writing or art has been aggregated, dozens of downstream fine-tuning pipelines can train on it without ever seeing your original refusal. The IETF AIPREF working group, chartered in January 2025, is building a machine-readable vocabulary for content usage preferences, but it applies only to future crawls and has no retroactive reach into existing corpora. EU AI Act GPAI obligations that took effect in August 2025 require providers to honor opt-outs, but no technical enforcement mechanism exists for multi-hop pipelines where data has already changed hands.
Pourquoi c'est important
Opt-out rights that stop at the crawl boundary leave the accumulated stock of training data legally and technically unreachable.
Comment j'évalue l'opportunité
Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.
L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.
La fréquence à laquelle les gens y sont réellement confrontés.
Le peu de bons outils qui existent pour y remédier aujourd'hui.
D'autres problèmes qui méritent d'être résolus
Pourquoi chaque application IA m'oublie-t-elle dès que je ferme l'onglet ?
AIPourquoi apprendre un nouveau domaine est-il encore conditionné par le fait de savoir quoi demander ?
AIPourquoi un non-expert ne peut-il pas vérifier ce qu'une IA vient de lui dire ?
AIPourquoi teste-t-on les modèles sur des benchmarks mais les déploie-t-on à l'instinct ?
AIPourquoi les agents IA n'ont-ils aucun souvenir de leurs propres erreurs ?
AIPourquoi ne puis-je pas vérifier sur quoi un modèle a réellement été entraîné ?