MADRID 2 set. (Portaltic/EP) -
A Meta apresentou o Muse Voice Transcribe, um novo modelo de reconhecimento de voz multilíngue em tempo real que detecta a voz, inclusive de vários falantes, para realizar uma transcrição precisa.
O Muse Voice Transcribe foi desenvolvido pela Meta Superintelligence Labs e se apresenta como um modelo multimodal autorregressivo da família Muse Spark.
Ele oferece reconhecimento automático de voz em tempo real e, para isso, processa o áudio em fragmentos de 80 ms (12,5 Hz), utilizando uma técnica chamada atraso adaptativo, que ajusta dinamicamente o atraso introduzido para prever a próxima palavra, de acordo com a dificuldade.
Dessa forma, oferece “um equilíbrio ideal entre velocidade e precisão, medido pelo tempo necessário para a transcrição final”, conforme explica a Meta na página do Muse Voice Transcribe.
O modelo é multilíngue e foi treinado em mais de 70 idiomas, embora apenas 25 tenham sido “amplamente verificados”, entre os quais se incluem o espanhol, o português, o alemão, o italiano, o inglês, o chinês mandarim e o árabe.
A Meta explica que o Muse Voice Transcribe é capaz de distinguir em tempo real até 20 participantes em uma conversa, aos quais identifica individualmente com etiquetas do tipo “locutor 1”, “locutor 2”, etc.
A isso se soma sua capacidade de aceitar nativamente entradas de áudio de longa duração, que podem ultrapassar uma hora, e o aprimoramento da precisão por meio de ajuste por idioma, palavras-chave e contexto.
O Muse Voice Transcribe está disponível por meio da Meta Model API, do Meta AI para Mac e do Muse Code.
Esta notícia foi traduzida por um tradutor automático