MADRID 7 out. (Portaltic/EP) -
O Google DeepMind lançou seu novo modelo de pesos abertos, o EmbeddingGemma 2, para desenvolvedores, que se destaca não apenas por seu tamanho reduzido — o que permite sua instalação em um celular —, mas também por sua incorporação multimodal, que permite converter diferentes tipos de informação (texto, imagens, vídeo e áudio) em números (vetores) dentro de um mesmo sistema.
A empresa de tecnologia divulgou os detalhes do EmbeddingGemma 2, que, além de ser um modelo voltado para desenvolvedores e considerado o melhor da categoria por ser leve e exigir poucos recursos de computação, pode ser testado em um celular Android ou iPhone por meio do aplicativo Google AI Edge Gallery com duas demonstrações: busca instantânea de conteúdo offline e o “Video Moments Finder”.
A busca instantânea de conteúdo permite organizar e pesquisar fotos e vídeos localmente em tempo real à medida que as palavras são digitadas, ao relacionar frases ou imagens de exemplo com os vetores das fotos locais, armazenados em um banco de dados SQLite.
O “Video Moments Finder” é a outra demonstração disponível offline para celular, capaz de localizar quadros específicos dentro de vídeos locais com frases como “crianças rindo” ou “cachorro pegando uma bola de tênis”, ao analisar a imagem e trechos de áudio sem a necessidade de gerar transcrições de texto intermediárias.
Por outro lado, há outra demonstração para Mac na forma de um aplicativo experimental, o Google AI Edge Foresight, que atua como um assistente de reuniões local e privado ao se conectar ao áudio do sistema e ao microfone para funcionar offline com qualquer plataforma de videochamadas.
Esses são alguns exemplos da utilidade que o EmbeddingGemma 2 representa para os desenvolvedores. Ele se define por sua função principal de representar texto, imagens, quadros de vídeo e áudio em um único espaço vetorial numérico, o que permite relacionar e pesquisar qualquer tipo de arquivo sem a necessidade de tradução para texto.
Além disso, o modelo se destaca por seu tamanho compacto de 740 milhões de parâmetros e foi projetado para ser executado localmente no dispositivo, sem conexão à internet, a fim de garantir a privacidade dos dados, o que abre caminho para que os desenvolvedores integrem essas funções de busca em novos aplicativos ou em futuras atualizações.
Da mesma forma, o Google disponibilizou várias ferramentas para desenvolvedores, como o ML Kit (que será lançado nas próximas semanas), o MediaPipe Tasks e o LiteRT, para facilitar a integração do EmbeddingGemma 2.
Esta notícia foi traduzida por um tradutor automático