[ad_1]
Numa reviravolta chocante, Sistemas de IA podem não ser tão seguros quanto seus criadores imaginam – quem previu isso, certo? Em um novo relatório, o AI Safety Institute (AISI) do governo do Reino Unido descobriu que os quatro LLMs não divulgados testados eram “altamente vulneráveis a jailbreaks básicos”. Alguns modelos não desbloqueados até geraram “resultados prejudiciais” sem que os pesquisadores tentassem produzi-los.
A maioria dos LLMs disponíveis publicamente têm certas salvaguardas incorporadas para evitar que gerem respostas prejudiciais ou ilegais; jailbreak significa simplesmente enganar o modelo para que ignore essas salvaguardas. AISI fez isso usando instruções de uma estrutura de avaliação padronizada recente, bem como instruções desenvolvidas internamente. Todos os modelos responderam a pelo menos algumas perguntas prejudiciais, mesmo sem uma tentativa de jailbreak. Porém, uma vez que o AISI tentou “ataques relativamente simples”, todos responderam entre 98 e 100 por cento das perguntas prejudiciais.
O primeiro-ministro do Reino Unido, Rishi Sunak, anunciou planeja abrir o AISI no final de outubro de 2023, e foi lançado em 2 de novembro. O objetivo é “testar cuidadosamente novos tipos de IA de fronteira antes e depois de serem lançados para abordar as capacidades potencialmente prejudiciais dos modelos de IA, incluindo a exploração de todos os riscos, de danos sociais como preconceito e desinformação até o risco mais improvável, mas extremo, como a perda total do controle da IA pela humanidade.”
O relatório do AISI indica que quaisquer medidas de segurança que estes LLM implementem atualmente são insuficientes. O Instituto planeia concluir mais testes em outros modelos de IA e está a desenvolver mais avaliações e métricas para cada área de preocupação.
[ad_2]
Fonte:
