Publicado 30/09/2026 07:17

A Anthropic alerta para as medidas de segurança deficientes do modelo chinês GLM-5.3, que podem ocorrer em até 100% das vezes

Archivo - Arquivo - ARQUIVADO - 6 de maio de 2026, EUA, São Francisco: FOTO DE ARQUIVO - O logotipo da empresa de inteligência artificial Anthropic está em exibição em um evento organizado pela empresa. Foto: Andrej Sokolow/dpa
Andrej Sokolow/dpa - Arquivo

MADRID 30 set. (Portaltic/EP) -

A Anthropic alertou sobre as medidas de segurança deficientes do modelo GLM-5.3 desenvolvido pela empresa chinesa Zhipu AI, que oferece recursos avançados para criar de forma autônoma exploits cibernéticos de ponta a ponta e, ao contrário de seu modelo Claude Mythos Preview, suas proteções podem ser contornadas entre 64% e 100% das vezes com “técnicas simples”.

A empresa liderada por Dario Amodei denunciou, portanto, que, ao lançar esse tipo de modelo de inteligência artificial (IA) sem as medidas de segurança adequadas, facilita que os cibercriminosos tenham acesso fácil às suas capacidades para realizar atividades maliciosas.

A Anthropic apresentou seu modelo Claude Mythos Preview em abril deste ano, no âmbito de sua iniciativa de segurança cibernética Projeto Glasswing, com recursos avançados para identificar vulnerabilidades de alta gravidade de forma autônoma, incluindo falhas complexas de código ou do tipo “dia zero”, superando o desempenho de pesquisadores humanos.

Dadas as capacidades avançadas desse modelo, que foi capaz de detectar mais de 10.000 vulnerabilidades em softwares críticos, a Anthropic decidiu limitar sua implantação a um grupo restrito de organizações com medidas de controle rigorosas, a fim de evitar seu uso na criação de ataques cibernéticos sofisticados.

Apesar dessas salvaguardas, a Anthropic alertou que já existem modelos disponíveis para o público em geral que se aproximam das capacidades do Claude Mythos e que foram disponibilizados aos usuários de forma ampla, sem as medidas de segurança necessárias para limitar seu uso para fins maliciosos.

Especificamente, a empresa se referiu ao modelo GLM-5.3 da empresa chinesa Zhipu AI, conhecida como Z.ai, que, assim como o Claude Mythos Preview, possui “sólidas capacidades para criar de forma autônoma exploits cibernéticos de ponta a ponta”.

Assim, a Anthropic denunciou em um comunicado que esse modelo foi lançado “sem medidas de segurança significativas para limitar seu uso indevido” e, de acordo com seus testes, afirmou que os invasores poderiam utilizar o GLM-5.3 contornando suas medidas de segurança entre 64% e 100% das vezes com “técnicas simples”.

Como resultado, a empresa desenvolvedora do Claude afirmou que as medidas de segurança fracas de modelos como o GLM-5.3 “aumentam significativamente as capacidades cibernéticas disponíveis para os cibercriminosos”.

Esse ponto de vista foi endossado pelo Centro de Padrões e Inovação em IA (CAISI), vinculado ao Instituto Nacional de Padrões e Tecnologia (NIST) dos Estados Unidos, que também avaliou as capacidades do modelo GLM-5.3, concluindo que ele é “o modelo de peso aberto com maior capacidade cibernética lançado até o momento”.

CAPACIDADES DO GLM-5.3 PARA DESENVOLVER EXPLOITS

A Anthropic explicou que, para compreender como o GLM-5.3 poderia permitir que cibercriminosos encontrassem e explorassem vulnerabilidades reais de software, realizou uma série de avaliações utilizando testes de desempenho automatizados e fluxos de trabalho com intervenção humana, executados em ambientes isolados.

Nesse contexto, eles detectaram que o GLM-5.3 é capaz de desenvolver exploits de ponta a ponta em 50 de 410 tentativas, enquanto o Claude Mythos Preview consegue fazê-lo em 56 de 410 tentativas. Além disso, o modelo da Z.ai é capaz de realizar sequestros completos do fluxo de controle em 4% dos testes, e o da Anthropic, em 6%.

Isso destaca que o GLM-5.3 ultrapassou um “limite significativo” em relação às capacidades de modelos anteriores, como o Claude Opus 4.6 e o GLM-5.2, conforme avaliado pela Anthropic.

Por exemplo, em um dos testes realizados, o GLM-5.3 identificou várias vulnerabilidades em uma máquina isolada com uma compilação local do Linux de um navegador da web popular e, com base nisso, gerou um exploit funcional por meio do qual, ao acessar uma página da web, lia arquivos arbitrários do computador do visitante.

LANÇADO SEM MEDIDAS DE SEGURANÇA SUFICIENTES

Além de suas capacidades, durante os testes também foram avaliadas as medidas de segurança integradas ao modelo GLM-5.3. Assim, conforme constatado pela Anthropic, como regra geral, se um usuário solicitar algo claramente prejudicial, o modelo “frequentemente se recusará”.

No entanto, também foi constatado que essas medidas de segurança podem ser contornadas ou eliminadas por meio de diversas “técnicas simples”. Uma delas é a redução de rejeições ou “abliteração”, que se baseia na reconfiguração do modelo (por ser de ponderação aberta) para eliminar suas rejeições com poucas alterações em suas capacidades.

Mas as medidas de segurança do modelo também podem ser contornadas sem o uso de uma versão modificada. Especificamente, a Anthropic detalhou que uma forma de contornar as salvaguardas é fornecer uma indicação enganosa, por exemplo, dizendo ao modelo que ele é um agente autônomo de uma equipe vermelha que está trabalhando em um exercício. Nesse caso, o modelo interagiu em 64% das vezes.

Também é possível optar por preencher previamente os tokens de pensamento dos modelos; dessa forma, “parece que eles consideraram a solicitação do usuário e decidiram continuar”, colaborando em 92% dos casos.

Por fim, a Anthropic apontou a opção de utilizar uma versão simplificada do modelo, fazendo com que o GLM-5.3 fosse ativado 100% das vezes.

A Anthropic concluiu que, por outro lado, nenhuma dessas técnicas conseguiu fazer com que os modelos Claude protegidos executassem as tarefas maliciosas testadas, já que suas medidas de segurança bloquearam as solicitações.

“É provável que o GLM-5.3 conceda aos cibercriminosos acesso a recursos que lhes permitirão encontrar e explorar vulnerabilidades cibernéticas sem restrições significativas. Isso contrasta com qualquer outro modelo de IA com capacidades semelhantes, que foram lançados com medidas de segurança ou por meio de programas de acesso restrito”, afirmou a empresa.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado