MADRID 27 ago. (Portaltic/EP) -
O Google apresentou seu novo modelo de conversão de voz em texto, o Gemini 3.5 Transcribe, projetado para interações de voz inteligentes e com capacidade de capturar o estilo natural da fala, reconhecer vocabulário personalizado e realizar tarefas por meio da voz, inclusive preenchendo campos de texto no Chrome.
A gigante da tecnologia afirmou que este é seu modelo “mais preciso até o momento”, pois compreende perfeitamente a fala dos usuários e a transcreve em mais de 85 idiomas, inclusive eliminando expressões de preenchimento como “ums” ou “ahs” e captando a intenção natural e o estilo.
Isso foi divulgado em um comunicado em seu blog, onde foi detalhado que o Gemini 3.5 Transcribe também foi aprimorado para capturar áudio com precisão em ambientes barulhentos, distinguir até três interlocutores diferentes com marcas de tempo e detectar sotaques regionais ou dialetos.
Especificamente, o Google explicou que o modelo converte o áudio bruto diretamente em texto “preciso, refinado e formatado”, gerenciando as autocorreções enquanto a pessoa fala e formatando automaticamente o texto para refletir a intenção final.
Essas melhorias se traduzem em dados como uma taxa média de erro de palavras (WER) de 4% para transmissão de dados e de 2,6% para casos de uso sem transmissão, de acordo com medições da Artificial Analysis.
Nessa linha, ele também apresenta taxas de erro de palavras aprimoradas e uma latência reduzida em relação ao modelo anterior. Por exemplo, o Google garante que o tempo para a transcrição final melhora em 70%.
TRANSCRIÇÃO INTELIGENTE PARA UM TRABALHO INTUITIVO
Além de apresentar o modelo, o Google também explicou como a conversão de voz em texto pode ajudar a tornar o trabalho “mais natural e intuitivo”. Assim, com o Gemini 3.5 Transcribe, a empresa anunciou que integra a compreensão contextual diretamente em interfaces como o Gboard, o Antigravity, o aplicativo Gemini e, em breve, no Chrome.
Na prática, no Gboard para Android, o Gemini 3.5 Transcribe permitirá transformar pensamentos falados em texto, eliminando as palavras de preenchimento. Da mesma forma, no Google Antigravity, ele poderá combinar o contexto da tela e o histórico de bate-papo dos usuários para realizar uma transcrição precisa.
O mesmo ocorre no Google AI Studio, onde os usuários poderão utilizar o modelo para escrever código de aplicativos por meio da voz, embora ele esteja disponível apenas no modo Build.
Por outro lado, no aplicativo Gemini para macOS, o modelo facilitará o uso de comandos de voz que se integrarão ao contexto da tela para otimizar fluxos de trabalho. Por exemplo, ao solicitar resumos de arquivos, reutilizar texto em diferentes aplicativos ou gerar imagens, tudo isso apenas com a voz.
Por fim, o Google está trabalhando em uma opção no Chrome para que, por meio do Gemini 3.5 Transcribe, os usuários possam ditar texto em qualquer campo da web, com o objetivo de redigir respostas, publicações ou utilizar o Gemini de forma mais simples com a voz.
O Gemini 3.5 Transcribe já está disponível para todos os usuários no aplicativo Gemini para macOS em inglês e no Rambler para Android. Para desenvolvedores, foi lançado em versão prévia pública na API do Gemini por meio do Google AI Studio e do Google Antigravity. Também está disponível em versão prévia na Gemini Enterprise Agent Platform.
Esta notícia foi traduzida por um tradutor automático