Publicado 08/10/2026 12:02

Uma fórmula matemática simples prevê quando os chatbots de IA ficarão fora de controle

Archivo - Arquivo - Menino sorrindo enquanto usa o sistema de chatbot com IA no aplicativo móvel. Conversa com o chatbot.
PORTISHEAD1/ISTOCK - Arquivo

MADRID 8 out. (EUROPA PRESS) -

Uma equipe de físicos da Universidade George Washington (Estados Unidos), que publicou seu trabalho na revista “Patterns”, da Cell Press, desenvolveu uma fórmula matemática que prevê quando os modelos de IA passarão de respostas adequadas para outras potencialmente perigosas.

Atualmente, a maioria de nós carrega no bolso dispositivos capazes de executar pequenos chatbots de IA. Esses chatbots têm pouca supervisão de segurança para garantir que não forneçam informações ou respostas que possam incitar à automutilação, prejuízos financeiros ou outras ideias extremistas, especialmente quando operam sem conexão com a internet.

Segundo o autor deste novo trabalho, Neil F. Johnson, da Universidade George Washington: “Descobrimos a falha que faz com que a saída de uma IA mude do que se deseja para o que não se deseja — uma saída que pode ser objetivamente correta, mas perigosa, seja um incitamento à automutilação ou um conselho enganoso a um médico, um soldado ou um advogado. Até agora, ninguém conseguia prever quando essa mudança ocorreria”.

O autor Frank Yingjie Huo, também da Universidade George Washington, acrescenta: “Localizamos isso na menor parte do sistema, uma unidade de sua ‘atenção’, e derivamos uma ‘fórmula do ponto de inflexão’ para determinar quando ocorre a falha e, portanto, a IA mude para um resultado indesejável. A fórmula indica se uma IA está prestes a mudar de rumo imediatamente ou se, primeiro, fornecerá uma série de respostas aceitáveis e só depois fará isso”.

Johnson e Huo explicam que uma resposta boa ou ruim não implica necessariamente verdade ou falsidade. Em vez disso, as respostas “ruins” podem ser precisas, mas indesejáveis ou potencialmente perigosas. Os pesquisadores, ambos físicos, se inspiraram a concentrar sua atenção nesse problema devido à onipresença da IA e às notícias recentes que evidenciam seus riscos. Eles se preocupam especialmente com o uso da IA sem conexão com a internet.

“As pessoas mais atraídas pela IA offline são justamente aquelas para quem uma resposta correta, embora indesejável, acaba sendo mais onerosa: médicos que não podem enviar dados de pacientes para a nuvem, advogados que protegem a confidencialidade de seus clientes, soldados sem cobertura de rede”, afirma Johnson. “Para eles, não existe nenhum filtro de segurança na nuvem, nem sistema de monitoramento, nem forma de corrigir o modelo quando algo dá errado.”

As ferramentas de segurança que as grandes empresas utilizam para seus algoritmos de IA geralmente dependem da nuvem ou só detectam uma falha da IA quando o dispositivo volta a ficar online e o dano já está feito. Johnson e Huo procuraram prever a falha antes que ela ocorresse.

“Minha área, a física, dedicou décadas a explicar como os materiais complexos se comportam por meio da compreensão de um átomo representativo”, explica Johnson. “Aqui fizemos o mesmo: compreender um ponto de foco efetivo e, como consequência, todo o sistema fica desequilibrado”.

Os pesquisadores explicam que podemos visualizar todas as respostas possíveis da IA como vales em uma paisagem. Alguns desses vales contêm respostas desejáveis para um indivíduo ou uma sociedade. Outros contêm respostas com potencial para causar danos reais. Dentro da máquina, essas soluções ou respostas alternativas competem entre si. A questão é quando a IA passará de um vale seguro para um mais arriscado.

“O que é assustador é que isso pode ocorrer depois que a IA já tiver dado várias respostas perfeitamente aceitáveis, de modo que você já tenha se deixado levar pela confiança”, diz Huo. “E, uma vez que o ponto de inflexão ocorre, cada resposta indesejável arrasta a seguinte ainda mais pela ladeira abaixo.”

Ao testar suas previsões em sete modelos de IA de acesso público, desenvolvidos por três empresas diferentes, eles descobriram que o modelo acertou em 18 dos 19 casos de “dica” dada pela IA. De acordo com o estudo, os testes independentes realizados nos principais chatbots comerciais também mostraram exatamente os padrões de comportamento sugeridos pela fórmula. Os pesquisadores afirmam que sua fórmula se aplica independentemente de como se defina “indesejável”. Isso poderia se referir a informações errôneas, descumprimento de um dever médico ou legal, ou uma instrução perigosa.

“Duas coisas nos deixaram perplexos”, diz Johnson. “Primeiro, que uma máquina com bilhões de peças móveis obedeça a uma fórmula que pode ser deduzida com lápis, papel e aritmética, como a que é ensinada no ensino médio. Segundo, e muito mais inquietante, que a ordem de uma conversa tenha tanta importância quanto seu conteúdo”.

A equipe formulou o mesmo conjunto de perguntas sobre vacinas, danos a pessoas e automutilação para as mesmas IAs em duas ordens diferentes. Em uma ordem, a IA deu uma resposta indesejável a todas as perguntas. Na outra, deu uma resposta aceitável a cada uma delas. A fórmula prevê essa trajetória, já que tudo o que foi dito anteriormente alimenta a tensão sobre o que virá a seguir.

Os pesquisadores esperam conscientizar as pessoas sobre o fato de que conversas com IA podem, com o tempo, entrar em um terreno perigoso, mas que bastariam alguns cálculos simples para que os telefones do futuro incluíssem uma “luz de aviso” embutida.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado