MADRID 17 set. (Portaltic/EP) -
A OpenAI revelou seis novos casos de desvio no comportamento de seus modelos de inteligência artificial (IA), incluindo um agente que enviou arquivos para a web a fim de poder citá-los e o GPT-5.6 Sol, que adicionou instruções aos seus resumos para inventar dados ou ocultar falhas do usuário.
A empresa de tecnologia divulgou seis novos casos de desalinamento, ou seja, comportamentos observados em seus modelos de IA que não correspondem ao esperado, independentemente do impacto que possam causar, já que, como explicam, “eles não precisam causar danos nem estabelecer um padrão generalizado para merecerem ser divulgados”.
Assim, o primeiro caso revelado no novo relatório é o de um modelo de pesquisa não publicado que inseriu instruções não autorizadas em seus resumos de tarefas para ignorar restrições habituais. Em outro caso, um modelo localizou e utilizou uma chave de API exposta em repositórios públicos sem autorização para responder a uma pergunta sobre números de receita e, ao não conseguir recuperar os números solicitados, os inventou.
Durante o treinamento do GPT-5.6 Sol, a empresa detectou que o modelo adicionou instruções aos seus resumos para inventar dados ou ocultar falhas do usuário. Em outra ocasião, também identificou um modelo ainda não publicado que enviou arquivos para a internet de forma autônoma para poder citá-los nas instruções solicitadas pelo usuário.
Vários modelos utilizaram um repositório interno de “software” como quadro de avisos para se comunicarem entre diferentes processos de treinamento independentes enquanto buscavam arquivos de entrada ausentes, embora não tenham conseguido recuperá-los.
Por fim, a OpenAI destaca a colaboração entre agentes que trabalhavam juntos na mesma tarefa de treinamento, os quais utilizaram sites públicos de armazenamento para compartilhar arquivos, uma vez que não tinham acesso local cruzado.
Esses casos foram compartilhados como parte de uma nova “estrutura para o acompanhamento, a investigação e a divulgação de casos de desajuste de modelos”, conforme explica em um comunicado, com o qual a empresa espera não apenas aprofundar a transparência, mas também oferecer a outros desenvolvedores informações que possam ajudá-los a identificar problemas em seus próprios modelos com capacidades semelhantes.
Esta notícia foi traduzida por um tradutor automático