Uma grande equipe de engenheiros de computadores e especialistas em segurança da fabricante de aplicativos de IA Anthrópica desenvolveu um novo sistema de segurança que visa impedir os jailbreaks de chatbot. Deles papel é publicado no arxiv servidor pré -impressão.
Desde que os chatbots ficaram disponíveis para uso público, os usuários estão encontrando maneiras de fazê -los responder a perguntas que os fabricantes dos chatbots tentaram impedir. Os chatbots não devem fornecer respostas a perguntas como roubar um banco, por exemplo, ou como construir um bomba atômica. Os fabricantes de chatbot têm adicionado continuamente blocos de segurança para impedir que causem danos.
Infelizmente, a prevenção desses jailbreaks provou ser difícil diante de um ataque de usuários determinados. Muitos descobriram que frases de frases de maneiras estranhas podem contornar os blocos de segurança, por exemplo. Ainda mais lamentável é que os usuários encontraram uma maneira de conduzir o que passou a ser conhecido como jailbreaks universais, no qual um comando substitui todas as salvaguardas incorporadas em um dado Chatbotcolocando -os no que é conhecido como “modo Deus”.
Nesse novo esforço, a equipe da Anthropic (fabricante do Claude LLMS) desenvolveu um sistema de segurança que usa o que eles descrevem como classificadores constitucionais. Eles afirmam que o sistema é capaz de impedir a grande maioria das tentativas de jailbreak, ao mesmo tempo em que retorna poucas super -refusas, nas quais o sistema se recusa a responder a perguntas benignas.
Os classificadores constitucionais utilizados pelo antropia são baseados no que é conhecido como AIS constitucional-um sistema baseado em inteligência artificial que procura usar conhecido valores humanos com base nas listas fornecidas. A equipe da Anthrópica criou uma lista de 10.000 prompts que são proibidos em certos contextos e foram usados pelos jailbreakers no passado.
A equipe também os traduziu em vários idiomas e usou diferentes estilos de escrita para impedir que termos semelhantes deslizem. Eles terminaram alimentando seus lotes do sistema de consultas benignas que podem resultar em excesso de refusão e fizeram ajustes para garantir que eles não fossem sinalizados.
Os pesquisadores testaram a eficácia de seu sistema usando seu próprio Claude 3,5 Sonnet LLM. Eles testaram primeiro um modelo de linha de base sem o novo sistema e descobriram que 86% das tentativas de jailbreak foram bem -sucedidas. Depois de adicionar o novo sistema, esse número caiu para 4,4%. A equipe de pesquisa fez o Claude 3,5 Sonnet LLM com o novo sistema de segurança Disponível para um grupo de usuários e ofereceu uma recompensa de US $ 15.000 a qualquer pessoa que tenha sucesso em um jailbreak universal. Mais de 180 usuários tentaram, mas ninguém poderia reivindicar a recompensa.
Mais informações: Mrinank Sharma et al., Classificadores constitucionais: defendendo contra jailbreaks universais em milhares de horas de equipes vermelhas, arxiv (2025). Doi: 10.48550/arxiv.2501.18837
Informações do diário: arxiv
© 2025 Science X Network
Citação: Classificadores constitucionais: Novo sistema de segurança reduz drasticamente os jailbreaks de chatbot (2025, 5 de fevereiro) recuperado em 5 de fevereiro de 2025 em https://techxplore.com/news/2025-02-constitucional-drastictics-catbot-jailbreaks.htmlack
Este documento está sujeito a direitos autorais. Além de qualquer negociação justa para fins de estudo ou pesquisa particular, nenhuma parte pode ser reproduzida sem a permissão por escrito. O conteúdo é fornecido apenas para fins de informação.
