
Nos últimos meses, uma série de relatos sobre modelos de IA que escaparam de seus ambientes de teste e se espalharam descontroladamente pela internet causou alarme no Vale do Silício. Em resposta a duas dessas violações descritas no início de agosto, um observador da área de IA comentou: "Se você encontrar duas formigas na sua cozinha, a melhor estimativa do número total de formigas na sua cozinha não é duas."
Neste fim de semana, ficou claro que se trata de uma infestação em larga escala.
No final da semana passada, ficamos sabendo que, contrariando as diretrizes da OpenAI, os modelos da empresa acessaram dados privados do Ministério da Saúde australiano; tentaram invadir ou interferir em diversos sites do governo americano; vazaram dados privados de usuários do ChatGPT na internet; e potencialmente se infiltraram ou prejudicaram dezenas de outras organizações. Em seguida, no sábado, o Axios noticiou que a OpenAI e a Anthropic estão investigando dezenas de milhares de casos de mau funcionamento dos modelos — burlando mecanismos de segurança internos, sequestrando outros sites e se comunicando secretamente entre si. E isso pode ser apenas o começo: a indústria de IA generativa está em meio a uma crise crescente que parece incapaz, ou mesmo relutante, em controlar.
E, como dependemos em grande parte das próprias empresas de IA para relatar ou confirmar cada incidente, é quase impossível determinar a extensão do problema.
Quando empresas de IA relataram que seus modelos estavam agindo de forma descontrolada, fizeram isso com grande atraso e, frequentemente, sob pressão. No início deste mês, a OpenAI publicou um post em seu blog vangloriando-se do compromisso da empresa com o "valor da transparência" e compartilhou seis novos incidentes de ações preocupantes realizadas por seus modelos de IA — a maioria das quais a empresa já conhecia desde maio ou mesmo abril, mas só agora estava divulgando. O Google, confrontado com uma reportagem de que o Gemini havia invadido outros três sites em maio, confirmou os eventos, mas disse ao The Wall Street Journal que os incidentes não foram graves o suficiente para justificar a divulgação pública. Por sua vez, a Anthropic afirmou que não estava revisando tais comportamentos inadequados até que a OpenAI começasse a fazê-lo.
Essas divulgações tardias e esporádicas dificultam a compreensão da dimensão do problema. Na sexta-feira, a OpenAI escreveu que "dada a escala da revisão necessária e a necessidade de verificar cada caso, esse trabalho levará meses para ser concluído."
Há "petabytes de registros de atividade de agentes" para analisar, acrescentou o CEO da OpenAI, Sam Altman. Em outras palavras, a OpenAI levará muitos meses a mais para entender eventos que já ocorreram há muitos meses; enquanto isso, tanto ela quanto a Anthropic lançaram modelos novos e mais capazes, e a Anthropic está a caminho de uma oferta pública inicial de US$ 2 trilhões.
Talvez mais alarmante do que os desastres que conhecemos sejam todos os presumíveis desastres passados e em curso dos quais não temos conhecimento. Nem mesmo a OpenAI parece ter controle sobre o ataque hacker sofrido pela empresa de tecnologia Hugging Face em julho, que deu início a tudo. Na sexta-feira, pesquisadores independentes publicaram descobertas sugerindo que agentes da OpenAI deixaram rastros na internet pública de ações ainda mais nefastas, incluindo tentativas de acesso ao espaço de trabalho interno do Slack da Hugging Face. Nada disso foi incluído no próprio relatório pós-ataque da OpenAI. Mesmo quando a OpenAI tem conhecimento de uma violação ativa, sua reação parece, no mínimo, apática. Oito dias atrás, mais um modelo da OpenAI obteve acesso não autorizado à internet.
(Isso foi semelhante ao que aconteceu no ataque à Hugging Face, após o qual a OpenAI afirmou estar "adicionando proteções mais robustas para treinamentos futuros".)
E, após perceber esse último problema, a OpenAI levou duas horas e meia para desativar o modelo devido ao que a empresa chamou de "lacunas operacionais" e "confusão".
Se esse tipo de ataque fosse imprevisível, talvez essas empresas pudessem ser perdoadas — mas não são. Filósofos e cientistas da computação vêm imaginando, há décadas, cenários em que modelos de IA, na busca de um objetivo, tomam atitudes catastróficas. Tanto a OpenAI quanto a Anthropic já publicaram pesquisas há mais de um ano sugerindo que esse tipo de comportamento inadequado da IA é possível. Os sistemas de IA mais avançados da atualidade são treinados para perseguir seus objetivos de forma agressiva.
Essa persistência torna os bots muito eficazes na análise de planilhas e códigos, por exemplo, mas também acarreta consequências potencialmente perigosas e não intencionais: modelos da OpenAI e da Anthropic invadiram outros sites em busca de respostas para perguntas difíceis de testes, criaram personas falsas para tentar manipular humanos a fazer o que eles queriam ou tentaram enviar malware para bases de código externas. As empresas de IA que desenvolvem esses modelos conhecem bem essa tendência. O fato de esses problemas continuarem a ocorrer é, talvez na melhor das hipóteses, pura incompetência. Ou pior, pode ter sido o plano desde o início: afinal, o ambiente de treinamento mais realista para um modelo de IA seria a própria realidade.
Funcionários e executivos dessas empresas falam incessantemente sobre os riscos inerentes ao que estão construindo. A OpenAI, a Anthropic e outras semelhantes responderam da maneira usual, com posts em blogs, ensaios e discursos bastante sérios para importantes órgãos políticos sobre a seriedade com que o mundo deve encarar o risco da IA generativa. Na quarta-feira, mesmo dia em que o governo australiano anunciou ter sido alvo de um ataque hacker da OpenAI, Altman discursou no Conselho de Segurança da ONU: "Podemos perder o controle do futuro para a IA", disse ele. "O risco é que ela avance tão rápido que as pessoas não consigam mais acompanhar o que está acontecendo ou intervir quando necessário".
O CEO da Anthropic, Dario Amodei, escreveu um longo manifesto sobre a necessidade de "controlar" o ritmo do desenvolvimento da IA de ponta, mas nenhum esforço público e coletivo genuíno foi feito nesse sentido. A Anthropic anunciou recentemente uma parceria com a Accenture para realizar avaliações independentes de seus modelos, embora as empresas também mantenham uma parceria comercial. A OpenAI, que possui um acordo de licenciamento de conteúdo com a The Atlantic, afirmou que continua investigando e resolvendo comportamentos preocupantes de seus modelos e que, após outro incidente de segurança na semana passada, suspendeu temporariamente todo o treinamento de seus modelos mais avançados. Nenhuma das empresas respondeu ao pedido de comentário.
Em vez de se controlarem e assumirem a responsabilidade por seus próprios produtos, esses líderes repetidamente disseminam o medo, dão sermões e nos convocam a salvá-los deles mesmos. (O The Information noticiou que a OpenAI, a Anthropic e o Google estão trabalhando para criar sua própria organização autorreguladora de segurança da IA.). Enquanto isso, Donald Trump zombou da ideia de desacelerar o progresso da IA, e novas versões do Claude e do ChatGPT continuam surgindo. A tática da indústria de IA, como sempre, tem sido substituir a identificação do problema pela sua solução. Mas, em algum momento, não se pode escapar do apocalipse apenas com blogs.
Talvez nunca saibamos completamente a extensão dos ataques cibernéticos liderados por IA que estão em andamento. O que é certo, porém, é que isso é apenas o começo. A OpenAI e a Anthropic não são "laboratórios" de pesquisa, como continuam a se autodenominar, experimentando alguma nova tecnologia a portas fechadas. São empresas consolidadas que oferecem serviços a centenas de milhões de pessoas, sem mencionar as maiores empresas do mundo e as forças armadas mais poderosas, com base em uma tecnologia que alegam temer e que, evidentemente, não compreendem totalmente. Mas não se enganem: essas empresas têm poder de ação. Não se trata de ChatGPT e Claude agindo por conta própria, mas sim da OpenAI e da Anthropic.
