Categorias
Tecnologia

O AI Safety Institute do Reino Unido desbloqueia facilmente os principais LLMs

[ad_1]

Numa reviravolta chocante, Sistemas de IA podem não ser tão seguros quanto seus criadores imaginam – quem previu isso, certo? Em um novo relatório, o AI Safety Institute (AISI) do governo do Reino Unido descobriu que os quatro LLMs não divulgados testados eram “altamente vulneráveis ​​a jailbreaks básicos”. Alguns modelos não desbloqueados até geraram “resultados prejudiciais” sem que os pesquisadores tentassem produzi-los.

A maioria dos LLMs disponíveis publicamente têm certas salvaguardas incorporadas para evitar que gerem respostas prejudiciais ou ilegais; jailbreak significa simplesmente enganar o modelo para que ignore essas salvaguardas. AISI fez isso usando instruções de uma estrutura de avaliação padronizada recente, bem como instruções desenvolvidas internamente. Todos os modelos responderam a pelo menos algumas perguntas prejudiciais, mesmo sem uma tentativa de jailbreak. Porém, uma vez que o AISI tentou “ataques relativamente simples”, todos responderam entre 98 e 100 por cento das perguntas prejudiciais.

O primeiro-ministro do Reino Unido, Rishi Sunak, anunciou planeja abrir o AISI no final de outubro de 2023, e foi lançado em 2 de novembro. O objetivo é “testar cuidadosamente novos tipos de IA de fronteira antes e depois de serem lançados para abordar as capacidades potencialmente prejudiciais dos modelos de IA, incluindo a exploração de todos os riscos, de danos sociais como preconceito e desinformação até o risco mais improvável, mas extremo, como a perda total do controle da IA ​​pela humanidade.”

O relatório do AISI indica que quaisquer medidas de segurança que estes LLM implementem atualmente são insuficientes. O Instituto planeia concluir mais testes em outros modelos de IA e está a desenvolver mais avaliações e métricas para cada área de preocupação.

[ad_2]

Fonte:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *