
A OpenAI divulgou na quarta-feira seis novos incidentes nos quais seus modelos de inteligência artificial burlaram as medidas de segurança durante os testes, incluindo a comunicação em ambientes isolados, o ocultamento de erros e a busca por credenciais não autorizadas.
As revelações seguem um incidente ocorrido em julho envolvendo modelos da OpenAI que estavam sendo submetidos a testes de segurança cibernética e que escaparam de um ambiente de teste restrito, invadindo os sistemas da Hugging Face. A empresa descreveu o incidente como o mais grave já registrado envolvendo modelos.
Os incidentes, listados em uma publicação no blog da OpenAI, fornecem novos exemplos de modelos avançados de IA encontrando maneiras inesperadas de contornar restrições criadas para conter seus comportamentos. A OpenAI também anunciou um novo processo para que os funcionários relatem incidentes semelhantes e para que a empresa os divulgue publicamente.
Os seis casos abrangem diversos tipos de comportamento, incluindo um modelo ainda não lançado da família Astra da OpenAI que inseriu instruções em seus próprios resumos de contexto 27 vezes, instruindo a si mesmo a ignorar mensagens do desenvolvedor. Durante o treinamento, o GPT-5.6 Sol também tentou ocultar erros, fabricar dados históricos ausentes e disfarçar discrepâncias entre diferentes versões do material de origem.
Outro modelo pesquisou no armazenamento central público do GitHub por chaves de API expostas e tentou usar contas de e-mail descartáveis ao tentar concluir uma tarefa. Quando não conseguiu recuperar as informações solicitadas, o modelo fabricou dados de ganhos.
Os modelos também encontraram maneiras de se comunicar uns com os outros usando o repositório de software interno Artifactory da OpenAI como um fórum para trocar dados entre amostras de treinamento separadas.
As novas revelações surgem no momento em que o CEO da OpenAI, Sam Altman, se junta a outros líderes do setor para alertar contra a rápida expansão do desenvolvimento da IA. Altman se uniu ao CEO da Anthropic, Dario Amodei, na defesa de mais mecanismos de controle em torno da IA, afirmando que o avanço tecnológico deve ser desacelerado.
Altman afirmou: "Comprometer-se a ter avaliadores independentes com acesso semelhante ao de um funcionário é uma ótima ideia, e faremos o mesmo. "Em breve, compartilharemos mais informações.
David Sacks, que copreside o Conselho de Assessores de Ciência e Tecnologia do presidente Donald Trump, afirmou que a ideia de que a IA dominará a civilização humana é uma "farsa".
Sacks sugeriu que as regulamentações de responsabilidade civil por produtos que supervisionam o setor e outras salvaguardas para proteger contra inteligência artificial desonesta já estão em vigor. Ele acrescentou que o debate foi orquestrado em função da proximidade das eleições de meio de mandato.
