Skip to content
AI

Como sei se o modelo base de pesos abertos que estou ajustando não foi envenenado?

83

Oportunidade

Backdoors implantados em pesos de modelos pré-treinados persistem durante o ajuste fino de parâmetros completos, treinamento de adaptadores e atualizações de RLHF porque os padrões de gatilho sobrevivem a estratégias de mudança de objetivo e congelamento parcial. Esses gatilhos são invisíveis para testes comportamentais de segurança padrão e avaliações em benchmark. Detectá-los requer análise de pesos white-box que o praticante médio de ajuste fino nunca realiza, e os principais hubs de modelos não aplicam varredura obrigatória antes de um checkpoint ser disponibilizado para download público. Uma organização que constrói um sistema de produção sobre um modelo base comprometido não tem nenhum sinal de que algo está errado até que o gatilho dispare em produção.

Por que importa

A cadeia de fornecimento de ajuste fino de pesos abertos não possui nenhuma barreira de segurança, e o modo de falha é um backdoor que sobrevive a todas as verificações padrão.

Como avalio a oportunidade

A Pontuação de Oportunidade é minha própria leitura, não uma medição: o quanto dói, com que frequência aparece e o quanto pouco existe para resolvê-lo hoje. Quanto maior, mais vale a pena construir, na minha opinião.

Gravidade9/10

O quanto de dor causa quando aparece.

Frequência7/10

Com que frequência as pessoas realmente se deparam com isso.

Lacuna8/10

O quanto pouco de boas ferramentas existe para isso hoje.

Mais problemas que merecem ser resolvidos