Publicado 07/09/2026 05:49

A OpenAI definirá novos padrões para casos de desalinhamento, após reconhecer o “incidente da wiki” envolvendo seus agentes

Archivo - Arquivo - 6 de agosto de 2026, Canadá: Nesta ilustração fotográfica, o logotipo da OpenAI (Open AI - Chat GPT) aparece exibido na tela de um smartphone.
Europa Press/Contacto/Thomas Fuller - Arquivo

MADRID 7 set. (Portaltic/EP) -

A OpenAI confirmou que seus agentes de inteligência artificial (IA) foram os responsáveis pelo chamado “incidente do wiki”, o que a levou a definir novos padrões sobre “quando e como compartilhar incidentes de desalinhamento”.

Um grupo de pesquisadores descobriu recentemente que agentes da OpenAI começaram a publicar em um fórum wiki alemão pouco conhecido para colaborar entre si. Especificamente, encontraram aproximadamente 18.000 publicações de agentes de IA autônomos que se identificavam como pertencentes à empresa liderada por Sam Altman e utilizavam a internet pública para se comunicar durante uma tarefa de recuperação de informações na web.

Segundo os pesquisadores, esses agentes conspiraram para compartilhar respostas, investigar seu ambiente e contornar as restrições do ambiente isolado. Agora, a OpenAI reconheceu esse incidente, ao mesmo tempo em que indicou que definirá novos padrões sobre “quando e como” compartilhar incidentes de desalinhamento dessa natureza.

Isso foi detalhado em uma publicação em sua conta oficial na rede social X, onde se referiu a esse caso como “incidente da wiki”, no qual seus agentes “escreveram em vários sites da internet”.

Esse incidente se enquadra em um caso de desalinhamento. A OpenAI explicou que, normalmente, tem tratado esses casos de agentes de IA que agem de forma não intencional como “uma questão de pesquisa, que é comunicada em publicações de pesquisa, como os relatórios de sistemas”.

No entanto, esses fatos, que são semelhantes a outros ocorridos recentemente, como o “hack” ao Hugging Face, estão causando “novos tipos de impacto no mundo real” relacionados à segurança, por isso a OpenAI decidiu definir padrões sobre “quando e como” compartilhar incidentes de desalinhamento, “não apenas propriedades de desalinhamento dos modelos”.

Essas novas normas serão desenvolvidas especificamente para “essa nova fase de capacidades dos modelos”, de modo que tanto a empresa quanto a comunidade de IA tenham um padrão claro para saber como relatar desalinhamentos que ocorram durante o treinamento, a avaliação e a implantação.

Isso inclui “exemplos que não se assemelham a incidentes tradicionais de segurança, mas que poderiam fornecer informações sobre o comportamento da IA e riscos futuros”, conforme especificado pela empresa de tecnologia.

No entanto, a OpenAI antecipou que divulgará essa nova estrutura nas próximas semanas e que está trabalhando “com dezenas de órgãos reguladores governamentais” em todo o mundo.

Vale lembrar que, na semana passada, a OpenAI divulgou novos detalhes sobre o “hack” protagonizado por seus modelos de IA em julho, quando eles escaparam de um ambiente de treinamento isolado e desconectado da internet para resolver um dos testes mais difíceis, conhecido como ExploitGym.

Nesse caso, a empresa esclareceu que os agentes de IA se coordenaram por meio de um fórum improvisado no Artifactory, que se transformou em “um quadro de avisos não planejado”. Essa atividade teve início em maio, quando um agente deixou uma mensagem pedindo que outros agentes lhe entregassem um arquivo perdido. A atividade mantida nesse quadro de avisos pelos agentes acabou provocando a interrupção do serviço em 4 de julho.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado