Publicado 02/09/2026 06:35

A Meta apresenta o Muse Voice Transcribe, seu modelo multilíngue e multifalante para transcrição de voz em tempo real

Archivo - Arquivo - Muse Voice Transcribe
META - Arquivo

MADRID 2 set. (Portaltic/EP) -

A Meta apresentou o Muse Voice Transcribe, um novo modelo de reconhecimento de voz multilíngue em tempo real que detecta a voz, inclusive de vários falantes, para realizar uma transcrição precisa.

O Muse Voice Transcribe foi desenvolvido pela Meta Superintelligence Labs e se apresenta como um modelo multimodal autorregressivo da família Muse Spark.

Ele oferece reconhecimento automático de voz em tempo real e, para isso, processa o áudio em fragmentos de 80 ms (12,5 Hz), utilizando uma técnica chamada atraso adaptativo, que ajusta dinamicamente o atraso introduzido para prever a próxima palavra, de acordo com a dificuldade.

Dessa forma, oferece “um equilíbrio ideal entre velocidade e precisão, medido pelo tempo necessário para a transcrição final”, conforme explica a Meta na página do Muse Voice Transcribe.

O modelo é multilíngue e foi treinado em mais de 70 idiomas, embora apenas 25 tenham sido “amplamente verificados”, entre os quais se incluem o espanhol, o português, o alemão, o italiano, o inglês, o chinês mandarim e o árabe.

A Meta explica que o Muse Voice Transcribe é capaz de distinguir em tempo real até 20 participantes em uma conversa, aos quais identifica individualmente com etiquetas do tipo “locutor 1”, “locutor 2”, etc.

A isso se soma sua capacidade de aceitar nativamente entradas de áudio de longa duração, que podem ultrapassar uma hora, e o aprimoramento da precisão por meio de ajuste por idioma, palavras-chave e contexto.

O Muse Voice Transcribe está disponível por meio da Meta Model API, do Meta AI para Mac e do Muse Code.

Esta notícia foi traduzida por um tradutor automático

Contador

Contenido patrocinado