MADRID 18 set. (Portaltic/EP) -
A Alibaba lançou o novo modelo de Inteligência Artificial (IA) Qwen3.8-Omni-Flash, que representou um grande avanço ao superar o Gemini 3.8 Flash, do Google, em processamento de voz e interação de áudio, além de proporcionar uma redução no custo da API de mais de 93% em relação à geração anterior.
A equipe por trás do Qwen3.8-Omni-Flash divulgou os detalhes de seu novo modelo de IA, que passou de um sistema que apenas “compreende” dados de múltiplas modalidades para um sistema projetado para planejar tarefas, utilizar ferramentas e executar fluxos de trabalho de agentes de IA em cenários de produtividade real.
De acordo com os “benchmarks” fornecidos pela Alibaba Cloud, sua melhoria é exponencial no reconhecimento de voz com vários interlocutores ao mesmo tempo, com taxas de erro muito baixas, enquanto que na compreensão musical é o melhor entre os modelos comparados e, na detecção de sons (SpotSoundBench), atinge 67,2 contra os 39,7 do Gemini 3.8 Flash do Google.
Essa conquista, somada à redução de preços em mais de 98% no setor de áudio e em mais de 93% no setor audiovisual, destaca a relevância desse modelo na guerra aberta entre os modelos de código aberto e os modelos fechados provenientes dos Estados Unidos
No entanto, ainda há um longo caminho a percorrer no raciocínio audiovisual em vídeo puro, uma capacidade na qual o Gemini, do Google, continua liderando.
De acordo com a Alibaba Cloud, o modelo eleva o padrão omnimodal em mais de 25% em média em relação à geração anterior, mantendo o desempenho em texto e com um contexto de um milhão de “tokens”.
No que diz respeito a outros testes de desempenho, o Qwen3.8-Omni-Flash se destaca em agentes multimodais com ferramentas (WildClawBench-MM) com 71,0, enquanto o Gemini atinge 58,9, e, em comparação com o Claude Opus 4.6 da Anthropic, supera-o em visão e tarefas de tela (navegação em celular, percepção visual do mundo real e raciocínio matemático visual).
A Alibaba também comparou seu novo Omni-Flash com o Opus 4.6 Max, um modelo da geração anterior ao atual Opus 5, embora seja importante levar em conta o fato de que um modelo flash (dedicado a respostas rápidas) seja capaz de superá-lo.
Após identificar seus pontos fortes e fracos, o Qwen3.8-omni-Flash se destaca, em primeiro lugar, pela interação omnimodal nativa para processar simultaneamente texto, visão e entrada e saída de áudio e, em segundo lugar, por uma integração otimizada com agentes de produtividade para execução de código, gerenciamento de documentos, interação em interfaces da web e de dispositivos móveis e automação de tarefas complexas passo a passo.
Em terceiro lugar, o laboratório Tongyi, responsável pelo desenvolvimento dos modelos de IA da Alibaba Cloud, aprimorou a adesão aos parâmetros estabelecidos para definir tons de conversa, personalidade, restrições de saída e uso rigoroso de chamadas de funções (com as quais é capaz de interagir com ferramentas externas, como consultar a previsão do tempo, o preço de uma ação etc.).
Por fim, o Qwen3.8-Omni-Flash processa melhor imagens, diagramas, esquemas e interfaces gráficas com maior precisão (2D/3D).
Esta notícia foi traduzida por um tradutor automático