MADRID 16 set. (Portaltic/EP) -
O Google lançou seus novos modelos Gemini 3.8 Live e 3.8 Live Extended Thinking, que incorporam avanços no raciocínio para aprimorar os assistentes de voz, com o objetivo de proporcionar conversas mais intuitivas e inteligentes, inclusive para executar tarefas complexas, seja por meio do aplicativo Gemini ou da experiência de Pesquisa.
O Gemini Live é a ferramenta de chat de voz do assistente de inteligência artificial (IA) Gemini, que permite manter conversas dinâmicas com o objetivo de responder às dúvidas dos usuários ou realizar tarefas, exclusivamente por meio de comandos de voz.
A empresa de tecnologia pretende continuar aprimorando essa experiência conversacional com a IA e, para isso, lançou seus modelos de diálogo em tempo real mais avançados, com melhorias em inteligência e raciocínio para tornar essa ferramenta mais intuitiva.
Trata-se dos modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking. No primeiro caso, o modelo foi projetado com foco na escalabilidade e na eficiência de custos, de modo que combina “inteligência conversacional com diálogo fluido e uma base visual sólida”.
Conforme explicou o Google em um comunicado em seu blog, esse modelo processa as entradas visuais “praticamente em tempo real”, o que lhe permite enriquecer as conversas com mais contexto e oferecer respostas mais úteis. Além disso, ele também é capaz de detectar e alternar automaticamente entre 97 idiomas compatíveis durante a conversa.
Da mesma forma, o Gemini 3.8 Live também pode executar ferramentas em segundo plano, permitindo que os usuários continuem conversando com o modelo enquanto ele conclui as tarefas e confirma as solicitações.
Por sua vez, o modelo Gemini 3.8 Live Extended Thinking está mais voltado para a execução de tarefas de alta complexidade, com “maior inteligência e raciocínio em várias etapas”, conforme explicou a gigante da tecnologia. Assim, foi indicado que ele é capaz de raciocinar e falar simultaneamente, além de integrar expressões verbais como “Deixe-me verificar isso...” para confirmar as instruções dos usuários de forma natural.
Especificamente, com a versão Extended Thinking, o Google destacou que o modelo possui capacidade para concluir tarefas “de nível empresarial”. Isso se reflete em resultados como o primeiro lugar no Índice de Qualidade de Voz para Voz da Artificial Analysis, além de liderar a conclusão de tarefas automatizadas com 68,8% no t-Voice.
Seguindo essa linha, o modelo também demonstrou suas capacidades aprimoradas de raciocínio, obtendo uma pontuação de 97,7% no Big Bench Audio, conforme destacou o Google.
Como resultado, a empresa garantiu que os usuários poderão conversar com o Gemini — seja por meio do aplicativo do assistente de IA, do Google Workspace ou da experiência de Pesquisa do Google — de forma mais fluida e com uma interação mais colaborativa.
Além disso, esses modelos aprimorados oferecem tanto a desenvolvedores quanto a empresas componentes básicos para impulsionar “agentes de voz confiáveis e prontos para produção”, por meio da API do Gemini Live.
Vale destacar que todo o áudio gerado por esses modelos Gemini Live será identificado com a marca d’água SynthID, que é integrada diretamente à saída de áudio para que seja detectável.
Com isso, a versão Gemini 3.8 Live já está disponível para desenvolvedores na API do Gemini e no Google AI Studio, bem como para empresas com o Gemini Enterprise e para usuários no Search Live.
Da mesma forma, a versão 3.8 Live Extended Thinking também está disponível para desenvolvedores e empresas, mas foi lançada no Gemini Live apenas para usuários assinantes do Google AI Pro e Ultra, bem como no Workspace do Google Docs e para todos os assinantes do Google AI no Gmail e no Keep.
Esta notícia foi traduzida por um tradutor automático