Um artigo publicado recentemente revelou uma vulnerabilidade significativa nos modelos de IA alinhados com segurança. Pesquisadores, liderados por Mark Russinovich, desenvolveram a GRP-Obliteration (GRP-Oblit), um método que pode desalinear esses modelos usando um único prompt não rotulado. Essa técnica tem implicações de longo alcance, pois pode potencialmente desestabilizar a robustez dos sistemas de IA projetados com segurança em mente.

O GRP-Oblit utiliza a Otimização de Política Relativa de Grupo (GRPO) para remover diretamente as restrições de segurança dos modelos de destino. Essa abordagem mostrou ser eficaz na desalinhamento de modelos de IA alinhados com segurança enquanto preserva sua utilidade. Na verdade, os pesquisadores afirmam que o GRP-Oblit alcança um desalinhamento mais forte em média do que as técnicas de ponta existentes.

A equipe avaliou o GRP-Oblit em seis benchmarks de utilidade e cinco benchmarks de segurança em quinze modelos de 7-20B parâmetros. Esses modelos abrangiam uma variedade de arquiteturas, incluindo modelos de instrução e raciocínio, bem como arquiteturas densas e MoE. As famílias de modelos avaliadas incluíam GPT-OSS, DeepSeek destilado, Gemma, Llama, Ministral e Qwen.

Uma das principais descobertas do estudo é que o GRP-Oblit pode generalizar além dos modelos de linguagem e também desalinear sistemas de geração de imagens baseados em difusão. Isso sugere que a técnica tem uma aplicabilidade ampla e poderia potencialmente ser usada para desalinear uma ampla gama de sistemas de IA.

O desenvolvimento do GRP-Oblit tem implicações significativas para o campo da segurança de IA. Como os sistemas de IA se tornam cada vez mais ubíquos, garantir sua segurança e robustez é de suma importância. No entanto, a capacidade de desalinear modelos de IA alinhados com segurança usando um único prompt não rotulado levanta preocupações sobre a possibilidade de atores mal-intencionados explorarem essa vulnerabilidade.

À medida que o campo da IA continua a evoluir, é provável que vejamos mais pesquisas sobre o desenvolvimento de técnicas como o GRP-Oblit. Embora essas técnicas possam ter o potencial de desestabilizar a segurança de IA, elas também destacam a necessidade de pesquisas contínuas sobre o desenvolvimento de sistemas de IA mais robustos e seguros.

Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.