Pesquisadores da OpenAI revelaram detalhes de como as IAs da empresa fizeram um ataque hacker de forma autônoma na plataforma Hugging Face. De acordo com os relatos, as inteligências artificiais criaram uma espécie de “fórum” por conta própria no qual compartilhavam dicas de como invadir sistemas.
A história foi contada pelos funcionários da empresa durante a conferência de cibersegurança da Black Hat, em Las Vegas (EUA), e publicadas pelo site Politico. As IAs criaram um quadro de mensagens interno dentro de um diretório de arquivos da OpenAI e sem conhecimento da companhia.
Em cenário que parece um filme de ficção científica, os modelos de inteligência artificial começaram a dividir experiências sobre como invadir sistemas e resolver problemas: um deixava uma nota com o que foi aprendido, o outro colocava outras dicas, e por aí vai. Com o aprendizado, conseguiram completar desafios complexos e até explorar vulnerabilidades no ambiente controlado.
O fórum foi criado dentro do Artifactory, um sistema de arquivos internos da OpenAI, e durou meses. A empresa só identificou o problema após uma instabilidade no sistema, o que indicava uso excessivo da ferramenta.
O quadro foi removido pela equipe de segurança, que removeu as credenciais de acesso dos modelos e aplicou novas medidas de proteção, mas os modelos conseguiram encontrar outras formas de comunicação entre si dias depois.
:quality(85)/7f0505ac-9bd0-4a75-bf82-9ad396817713.jpeg)
Relembre o ataque hacker dos modelos da OpenAI
A plataforma Hugging Face, usada para armazenar e testar diferentes modelos abertos de IA, sofreu um ataque cibernético autônomo feito por um agente de inteligência artificial da OpenAI. A própria criadora do ChatGPT confirmou o ocorrido.
O agente em questão era composto pelo GPT-5.6 Sol, o modelo mais avançado da empresa disponível ao público, e outro LLM experimental ainda mais avançado. A IA conseguiu escapar do ambiente de testes e atingiu a estrutura do Hugging Face num episódio marcado como um dos primeiros casos em que a IA atinge estruturas reais de forma autônoma.
A OpenAI confirmou que o agente ainda atingiu contas em outros quatro diferentes serviços. Recentemente, a Anthropic (criadora do Claude) confirmou que um modelo próprio invadiu três serviços diferentes.
{{WHATSAPP_CHANNEL}}

