Publicado 29/07/2026 05:05

A OpenAI lança novos modelos de voz com IA para transcrição e conversas em tempo real

Imagem do novo modelo de IA da OpenAI.
OPENAI

MADRID 29 jul. (Portaltic/EP) -

A OpenAI anunciou o lançamento de dois novos modelos de voz de Inteligência Artificial (IA) projetados especificamente para tudo o que diz respeito a conversas, seja para transcrevê-las em tempo real ou em lotes a partir de arquivos.

O laboratório de IA proprietário do ChatGPT anunciou, por meio de sua conta para desenvolvedores no X (antigo Twitter), a disponibilidade do GPT-Live-Transcribe, o modelo projetado para cargas de trabalho de baixa latência na transcrição de fala para texto, e do GPT-Transcribe, otimizado para arquivos de áudio completos e processamento em lote assíncrono.

Ambos os modelos têm a capacidade de compreender melhor o contexto das conversas e oferecem uma transcrição de áudio em tempo real de maior qualidade, compreendendo melhor sotaques e idiomas, bem como frases curtas, números, termos mais especializados e conversas com ruído de fundo intenso.

O GPT-Live-Transcribe se destaca por sua capacidade de utilizar automaticamente textos transcritos anteriormente como contexto.

O laboratório de IA compartilhou alguns dados sobre o desempenho dos modelos no teste de ASR com reconhecimento de contexto (Context Aware ASR) da OpenAI, que mostram que a possibilidade de adicionar contexto melhorou a precisão semântica de 38,5% para 44,6% no GPT-Live-Transcribe, enquanto no GPT-Transcribe passou de 41,6% para 45,2%.

Ou seja, fornecer informações a ambos os modelos, como os idiomas esperados ou o tema da reunião, melhora consideravelmente sua capacidade de transcrição, seja em uma conversa em tempo real ou por meio de um áudio gravado anteriormente para transcrição.

No que diz respeito ao desempenho em áudios do mundo real, o modelo GPT-Live-Transcribe registrou uma taxa de erro de transcrição de 9,60%, em comparação com os 11,65% obtidos com o GPT-Realtime-Whisper (a versão anterior de transcrição ao vivo da OpenAI), enquanto o GPT-Transcribe alcançou uma taxa de erro de 8,98%, reduzindo-a em relação aos 15,21% do Whisper-1 (o modelo original da OpenAI para conversão de voz em texto).

Por fim, o laboratório independente de análise Artificial Analysis relatou uma taxa de erro de palavras de 3,31% para o GPT-Transcribe. Isso representa uma melhoria digna de nota quando comparada aos modelos anteriores da OpenAI.

Nesse sentido, o GPT-Transcribe se torna o melhor modelo da OpenAI nessa categoria, embora fique ligeiramente atrás de alternativas como o Voxtral Small, da Mistral, e o Gemini 3.1 Pro, do Google, já que ambos apresentam uma taxa de erro de 2,8%.

O laboratório de IA fixou o preço do GPT-Transcribe em 4,50 dólares por cada mil minutos.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado