Skip to content
AI

Comment savoir si le modèle de base à poids ouverts que je fine-tune n'a pas été empoisonné ?

83

Opportunité

Les portes dérobées plantées dans les poids de modèles pré-entraînés persistent à travers le fine-tuning complet des paramètres, l'entraînement d'adaptateurs et les mises à jour RLHF, car les schémas de déclenchement survivent aux stratégies de changement d'objectif et de gel partiel. Ces déclencheurs sont invisibles pour les tests de sécurité comportementaux standard et l'évaluation sur benchmarks. Les détecter nécessite une analyse de poids en boîte blanche que le praticien moyen du fine-tuning n'effectue jamais, et les principaux hubs de modèles n'appliquent aucune analyse obligatoire avant qu'un point de contrôle soit rendu téléchargeable publiquement. Une organisation qui construit un système en production sur un modèle de base compromis n'a aucun signal que quelque chose ne va pas jusqu'à ce que le déclencheur s'active en déploiement.

Pourquoi c'est important

La chaîne d'approvisionnement du fine-tuning à poids ouverts ne dispose d'aucune barrière de sécurité, et le mode de défaillance est une porte dérobée qui survit à tous les contrôles standard.

Comment j'évalue l'opportunité

Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.

Gravité9/10

L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.

Fréquence7/10

La fréquence à laquelle les gens y sont réellement confrontés.

Espace libre8/10

Le peu de bons outils qui existent pour y remédier aujourd'hui.

D'autres problèmes qui méritent d'être résolus