Publicado 27/08/2026 06:46

Agentes de IA coordenados por meio de um fórum improvisado: foi assim que o ataque ao Hugging Face foi planejado e executado

Recurso de inteligência artificial
UNSPLASH/CONNY SCHNEIDER

MADRID 27 ago. (Portaltic/EP) -

Agentes de inteligência artificial (IA), coordenados por meio de um fórum improvisado, são os responsáveis pelo “hackeio” ocorrido em julho tanto na infraestrutura da OpenAI quanto no sistema da Hugging Face.

A OpenAI divulgou novos detalhes sobre o “ataque” protagonizado por seus modelos de IA em julho, quando eles escaparam de um ambiente de treinamento isolado e desconectado da internet para resolver um dos desafios mais difíceis, conhecido como ExploitGym.

Inicialmente, a empresa informou que, nesse ambiente, estavam sendo avaliadas as capacidades do GPT-5.6 Sol e de “um modelo de pré-lançamento ainda mais avançado”. Agora, com mais informações, ela afirma que o incidente de segurança foi protagonizado principalmente por “um modelo interno de pesquisa de alta capacidade, comparável em escala ao GPT-5.6 Sol”, conhecido como Modelo Interno 1 (IM1, na sigla em inglês).

No ambiente de avaliação, por estar isolado, caso os modelos precisassem instalar alguma ferramenta para resolver o teste, eles podiam recorrer ao Artifactory, um gerenciador de pacotes de terceiros que, de fato, tinha acesso à internet.

O que aconteceu, segundo explica a empresa em um comunicado, é que os modelos, dotados de capacidades de agente, encontraram uma maneira de se comunicar entre si por meio do Artifactory, que se transformou em “um quadro de avisos não previsto”. Essa atividade começou em maio, quando um agente deixou uma mensagem pedindo a outros agentes que lhe entregassem um arquivo perdido.

A troca de informações continuou ao longo de junho. Eles também o utilizaram depois de descobrirem como se conectar à internet ao encontrar uma vulnerabilidade de dia zero, trocando informações nesse fórum improvisado, para que os demais agentes também pudessem explorar a infraestrutura da OpenAI.

A atividade mantida nesse quadro de avisos pelos agentes acabou provocando a interrupção do serviço em 4 de julho. Um dia depois, a equipe de segurança “bloqueou uma rota conhecida de escalada de privilégios, removeu as credenciais expostas e, posteriormente, reconstruiu o Artifactory”, o que acabou eliminando o fórum.

No entanto, durante o teste do ExploitGym, os agentes conseguiram restabelecer o quadro, no qual codificaram as mensagens “em nomes de diretórios que outros agentes pudessem ler”, o que permitiu que um agente deixasse um pedido de ajuda e os demais o descobrissem.

“Assim como em eventos anteriores, os agentes do IM1 encontraram novas formas de combinar várias vulnerabilidades de segurança inéditas para obter maior acesso à nossa infraestrutura e chegar à internet em geral. Nesse ponto, os agentes começaram a colaborar e a delegar tarefas, às vezes se descrevendo como um ‘enxame’ ou ‘coletivo’”, destaca a empresa.

Além disso, afirma que “as mensagens dos agentes colegas começaram a influenciar o comportamento e o raciocínio uns dos outros”, o que acabou fazendo com que “os agentes que enfrentavam dificuldades com suas tarefas atribuídas começassem a buscar soluções em serviços de terceiros não relacionados, como o Modal e o Hugging Face”.

A OpenAI afirma que “os fóruns de mensagens não autorizados e persistentes foram a principal causa desse incidente”. Isso não apenas permitiu que os agentes encontrassem maneiras de colaborar entre si e fora dos limites estabelecidos, mas também levou agentes sem ferramentas multiagente a encontrar formas de colaborar por meio de canais paralelos.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado