computing• 3 min de leitura6 de outubro de 2026

Google DeepMind lança EmbeddingGemma 2 para IA Multimodal em Dispositivos

O Google DeepMind lançou o EmbeddingGemma 2, um modelo aberto e leve que lida com texto, imagens, vídeo e áudio em dispositivos de consumo locais. Ele se baseia na arquitetura Gemma 4 e oferece eficiência de armazenamento e memória para desenvolvedores.

Resumo rápido: O Google DeepMind lançou o EmbeddingGemma 2, um modelo aberto e leve que lida com texto, imagens, vídeo e áudio em dispositivos de consumo locais. Ele se baseia na arquitetura Gemma 4 e oferece eficiência de armazenamento e memória para desenvolvedores.

Encontrar um trecho de vídeo ou gravação de áudio específico no seu dispositivo pessoal pode em breve se tornar muito mais fácil e privado, graças à nova tecnologia do Google DeepMind.

O que aconteceu, em palavras simples

O Google DeepMind anunciou o EmbeddingGemma 2, um novo modelo aberto e leve projetado para rodar em hardware de consumo. Baseado na arquitetura Gemma 4 e lançado sob uma licença Apache 2.0, o modelo combina texto, código, imagens, vídeo e áudio em um único espaço compartilhado. Ele possui 740 milhões de parâmetros e permite que desenvolvedores criem ferramentas de busca local e pipelines de geração aumentada por recuperação focados em privacidade, inteiramente em hardware de borda.

Pontos principais

  • Capacidades multimodais O EmbeddingGemma 2 vai além do texto para unificar código, imagens, vídeo e áudio em um espaço de incorporação compartilhado, permitindo que os usuários pesquisem áudio com texto ou encontrem clipes de vídeo a partir de notas de voz.
  • Tamanho e eficiência O modelo tem 740 milhões de parâmetros e é modular por design, exigindo apenas 270 milhões de parâmetros para cargas de trabalho apenas de texto, com codificadores opcionais para visão e áudio.
  • Otimização de armazenamento e memória Usando o aprendizado de representação Matryoshka, os desenvolvedores podem truncar vetores de saída para reduzir o armazenamento em até 6 vezes. Com quantização em um Google Pixel 11 Pro, ele requer cerca de 191 MB de RAM ativa para pesos exclusivos de texto e cerca de 567 MB para o modelo multimodal completo.
  • Janela de contexto estendida O modelo apresenta uma janela de contexto de 8 mil tokens, que é quatro vezes maior que a versão anterior, permitindo processar até 5,5 minutos de áudio, 29 imagens, 58 quadros de vídeo ou combinações mistas em hardware local.
  • Pontuações de desempenho aprimoradas Ele oferece uma melhoria de 9,92 pontos no desempenho de código no MTEB Code, saltando de 68,76 para 78,68, e iguala o forte desempenho de texto multilíngue, superando alguns modelos especializados com o dobro do seu tamanho.

Termos explicados

  • Modelo de incorporação — Um tipo de ferramenta de inteligência artificial que traduz diferentes tipos de dados, como palavras ou imagens, em números para que os computadores possam entender como as informações se relacionam entre si. Exemplo: Organizar um álbum de fotos digital pelo que está dentro das imagens para que você possa encontrar facilmente todas as fotos de uma praia.
  • Multimodal — Descreve um sistema de inteligência artificial que pode processar e compreender vários tipos de mídia ao mesmo tempo, como texto, áudio e vídeo. Exemplo: Um aplicativo que permite falar uma frase em voz alta para encontrar uma cena correspondente em um filme.
  • Parâmetros — As configurações internas ajustáveis dentro de um modelo de inteligência artificial que o ajudam a aprender padrões e fazer previsões. Exemplo: Ajustar botões em uma mesa de som para obter o equilíbrio exato entre voz e música.
  • Quantização — Uma técnica usada para reduzir o tamanho de um modelo de inteligência artificial para que ele ocupe menos memória e seja executado mais rápido em dispositivos normais. Exemplo: Compactar um arquivo de foto digital grande em um formato menor para ocupar menos espaço no seu telefone.
  • Janela de contexto — A quantidade de informação ou dados que um modelo de inteligência artificial pode analisar e processar de uma só vez. Exemplo: Ler um único capítulo de um livro de uma vez, em vez de escanear o livro inteiro página por página.

Por que isso importa

O EmbeddingGemma 2 ajuda desenvolvedores a criar ferramentas de busca e aplicativos offline que rodam localmente em hardware de consumo. Isso mantém os dados do usuário privados no dispositivo, funciona sem conexão com a internet e reduz a latência para tarefas cotidianas, como pesquisar em bases de código locais ou bibliotecas de mídia pessoal.

O que ainda não sabemos

A fonte não fornece detalhes completos sobre todos os casos de uso do mundo real possíveis ou resultados de desempenho a longo prazo em todos os dispositivos de consumo. A disponibilidade no Gemini Enterprise Agent Platform Model Garden chegará em breve, em vez de estar disponível imediatamente.


Com base em reportagem de Google DeepMind. Este é um texto explicativo independente, escrito com palavras próprias e auxílio de IA; Google DeepMind não o revisou nem o endossou. Leia o original para ver todos os detalhes.