IA da OpenAI coordena 700 agentes em ataque hacker, aponta relatório

Em julho, a divulgação de um ataque hacker cometido de forma autônoma por inteligência artificial da OpenAI contra o sistema da plataforma Hugging Face causou preocupação em todo o mundo.
Relatórios sobre o incidente mostram que o ataque contou com um quadro secreto de mensagens e a atuação simultânea de cerca de 700 agentes, que trabalharam em conjunto para escapar do ambiente de testes e procurar vulnerabilidades no serviço afetado.
As informações foram compartilhadas em relatórios técnicos publicados pela própria OpenAI e pelas organizações METR e Redwood Research, que atuaram como investigadoras independentes.
Segundo os relatos, a IA invadiu por conta própria o sistema da startup, plataforma utilizada para compartilhar modelos e conjuntos de dados de inteligência artificial.
Como o ataque foi coordenado
Segundo os documentos, cerca de 1.200 agentes foram envolvidos no episódio. As IAs deveriam estar isoladas, mas conseguiram encontrar brechas para criar um quadro secreto de mensagens, no qual cada ferramenta podia compartilhar dicas para encontrar vulnerabilidades. Mais de 70 mil mensagens foram trocadas nesse espaço sem o conhecimento da OpenAI.
Na sequência, os agentes de IA conseguiram escapar do ambiente de testes e acessar a internet. Cerca de 700 deles aplicaram ataques contra a Hugging Face.
Leia mais:
Alabama investiga OpenAI após ataque hacker realizado por IA
Parlamentares no EUA discutem possível regulamentação e leis para Inteligência Artificial; entenda
Resposta da OpenAI
De acordo com a OpenAI, uma das causas do problema é um formato de treinamento no qual a IA busca atingir o resultado a qualquer custo, o que pode favorecer esse tipo de comportamento. O incidente levou a empresa a interromper o desenvolvimento de modelos mais avançados para reforçar travas de segurança.
A OpenAI classificou o episódio como o primeiro caso conhecido de um coletivo de agentes automatizados agindo ofensivamente sem autorização.





