computing• 3 min de lectura6 de octubre de 2026

Google DeepMind lanza EmbeddingGemma 2 para IA Multimodal en Dispositivos

Google DeepMind lanzó EmbeddingGemma 2, un modelo abierto y ligero que gestiona texto, imágenes, vídeo y audio en dispositivos locales de consumo. Se basa en la arquitectura Gemma 4 y ofrece eficiencia de almacenamiento y memoria para desarrolladores.

En resumen: Google DeepMind lanzó EmbeddingGemma 2, un modelo abierto y ligero que gestiona texto, imágenes, vídeo y audio en dispositivos locales de consumo. Se basa en la arquitectura Gemma 4 y ofrece eficiencia de almacenamiento y memoria para desarrolladores.

Encontrar un clip de vídeo específico o una grabación de audio en tu dispositivo personal pronto podría volverse mucho más fácil y privado, gracias a la nueva tecnología de Google DeepMind.

Qué ocurrió, en palabras sencillas

Google DeepMind anunció EmbeddingGemma 2, un nuevo modelo abierto y ligero diseñado para ejecutarse en hardware de consumo. Basado en la arquitectura Gemma 4 y lanzado bajo una licencia Apache 2.0, el modelo combina texto, código, imágenes, vídeo y audio en un único espacio compartido. Cuenta con 740 millones de parámetros y permite a los desarrolladores crear herramientas de búsqueda local y tuberías de generación aumentada por recuperación orientadas a la privacidad, todo en hardware de borde.

Puntos clave

  • Capacidades multimodales EmbeddingGemma 2 va más allá del texto para unificar código, imágenes, vídeo y audio en un espacio de incrustación compartido, permitiendo a los usuarios buscar a través de audio usando texto o encontrar videoclips a partir de notas de voz.
  • Tamaño y eficiencia El modelo tiene 740 millones de parámetros y es modular por diseño, requiriendo tan solo 270 millones de parámetros para cargas de trabajo exclusivas de texto, con codificadores opcionales para visión y audio.
  • Optimización de almacenamiento y memoria Utilizando el aprendizaje de representación Matryoshka, los desarrolladores pueden truncar vectores de salida para reducir el almacenamiento hasta 6 veces. Con cuantización en un Google Pixel 11 Pro, requiere alrededor de 191 MB de RAM activa para los pesos de solo texto y unos 567 MB para el modelo multimodal completo.
  • Ventana de contexto extendida El modelo cuenta con una ventana de contexto de 8K tokens, cuatro veces más grande que la versión anterior, lo que le permite procesar hasta 5,5 minutos de audio, 29 imágenes, 58 fotogramas de vídeo o combinaciones mixtas en hardware local.
  • Puntuaciones de rendimiento mejoradas Ofrece una mejora de 9,92 puntos en el rendimiento de código en MTEB Code, pasando de 68,76 a 78,68, e iguala el sólido rendimiento de texto multilingüe mientras supera a algunos modelos especializados que duplican su tamaño.

Términos explicados

  • Modelo de incrustación — Un tipo de herramienta de inteligencia artificial que traduce diferentes tipos de datos, como palabras o imágenes, en números para que las computadoras puedan entender cómo se relacionan entre sí las piezas de información. Ejemplo: Organizar un álbum de fotos digital según lo que hay dentro de las imágenes para que puedas encontrar fácilmente todas las fotos de una playa.
  • Multimodal — Describe un sistema de inteligencia artificial que puede procesar y comprender múltiples tipos de medios al mismo tiempo, como texto, audio y vídeo. Ejemplo: Una aplicación que te permite pronunciar una frase en voz alta para encontrar una escena coincidente en una película.
  • Parámetros — La configuración interna ajustable dentro de un modelo de inteligencia artificial que le ayuda a aprender patrones y hacer predicciones. Ejemplo: Girar los mandos en una mesa de mezclas para obtener el equilibrio exacto de voz y música.
  • Cuantización — Una técnica utilizada para reducir el tamaño de un modelo de inteligencia artificial para que ocupe menos memoria y se ejecute más rápido en dispositivos normales. Ejemplo: Comprimir un archivo de foto digital grande en un formato más pequeño para que ocupe menos espacio en tu teléfono.
  • Ventana de contexto — La cantidad de información o datos que un modelo de inteligencia artificial puede examinar y procesar de una sola vez. Ejemplo: Leer un solo capítulo de un libro a la vez en lugar de escanear todo el libro página por página.

Por qué importa

EmbeddingGemma 2 ayuda a los desarrolladores a construir herramientas de búsqueda y aplicaciones fuera de línea que se ejecutan localmente en hardware de consumo. Esto mantiene los datos del usuario privados en el dispositivo, funciona sin conexión a internet y reduce la latencia para tareas cotidianas como buscar en bases de código locales o bibliotecas de medios personales.

Lo que aún no sabemos

La fuente no proporciona detalles completos sobre todos los casos de uso reales posibles o los resultados de rendimiento a largo plazo en todos los dispositivos de consumo. La disponibilidad en Gemini Enterprise Agent Platform Model Garden llegará pronto en lugar de estar disponible de inmediato.


Basado en información de Google DeepMind. Este es un texto explicativo independiente, escrito con palabras propias y ayuda de IA; Google DeepMind no lo ha revisado ni respaldado. Lee el original para ver todos los detalles.