
Em destaque: Esta é uma exploração fascinante de como os LLMs (Modelos de Aprendizagem Baseados em Lógica) sucumbem a ataques de injeção de código.
Esta é uma exploração fascinante de como os LLMs (Modelos de Aprendizagem Baseados em Lógica) sucumbem a ataques de injeção de código. Descobrimos que eles aprendem a reconhecer o estilo do texto em diferentes blocos de função/ins
trução, e não apenas as tags. Nossa conclusão: as tags de função eram um truque de formatação que se tornou a arquitetura de segurança e o arcabouço cognitivo dos LLMs modernos.
Bastidores: Descobrimos que eles aprendem a reconhecer o estilo do texto em diferentes blocos de função/instrução, e não apenas as tags.
Mostramos que essa arquitetura não sobrevive nas representações reais do modelo e que essa confusão de funções está ligada à injeção de código. A menos que os LLMs alcancem uma percepção genuína de funções, acreditamos que a defe
sa contra injeções continuará sendo um jogo de bater em toupeiras perpétuo. E a natureza contínua dos limites de função abre a ameaça de injeções projetadas para alterar sutilmente os estados do LLM por meio de textos aparentement
Em síntese: Nossa conclusão: as tags de função eram um truque de formatação que se tornou a arquitetura de segurança e o arcabouço cognitivo dos LLMs modernos.
e inócuos, legalmente e em grande escala. De maneira mais geral, as funções são, discretamente, uma das abstrações mais importantes na pilha de LLM, fornecendo os limites destinados a separar o eu do outro, o pensamento da comunic
ação, a instrução dos dados. Elas são interruptores controlados por humanos em um sistema que, de outra forma, seria contínuo. Acreditamos que merecem muito mais estudo do que têm recebido. Artigo completo: “Injeção de estímulo como confusão de papéis”. Comentários de Simon Willison.
Fonte original:
Interesting Paper Exploring Prompt Injection
Categorias: Tecnologia, Cibersegurança, Privacidade
Marcador: Notícias