Google DeepMind lance EmbeddingGemma 2 pour l'IA multimodale sur les appareils
Google DeepMind a lancé EmbeddingGemma 2, un modèle ouvert et léger qui gère le texte, les images, la vidéo et l'audio sur les appareils grand public locaux. Il s'appuie sur l'architecture Gemma 4 et offre une efficacité de stockage et de mémoire aux développeurs.
En bref: Google DeepMind a lancé EmbeddingGemma 2, un modèle ouvert et léger qui gère le texte, les images, la vidéo et l'audio sur les appareils grand public locaux. Il s'appuie sur l'architecture Gemma 4 et offre une efficacité de stockage et de mémoire aux développeurs.
Trouver un clip vidéo ou un enregistrement audio spécifique sur votre appareil personnel pourrait bientôt devenir beaucoup plus simple et confidentiel, grâce à une nouvelle technologie de Google DeepMind.
Ce qui s'est passé, en mots simples
Google DeepMind a annoncé EmbeddingGemma 2, un nouveau modèle ouvert et léger conçu pour fonctionner sur du matériel grand public. S'appuyant sur l'architecture Gemma 4 et publié sous licence Apache 2.0, le modèle combine le texte, le code, les images, la vidéo et l'audio dans un espace partagé unique. Il comporte 740 millions de paramètres et permet aux développeurs de créer des outils de recherche locale et des pipelines de génération augmentée par récupération axés sur la confidentialité, entièrement sur du matériel de périphérie.
Points clés
- Capacités multimodales EmbeddingGemma 2 va au-delà du texte pour unifier le code, les images, la vidéo et l'audio dans un espace d'incorporation partagé, permettant aux utilisateurs de rechercher de l'audio avec du texte ou de trouver des clips vidéo à partir de mémos vocaux.
- Taille et efficacité Le modèle possède 740 millions de paramètres et est de conception modulaire, nécessitant seulement 270 millions de paramètres pour les charges de travail textuelles avec des encodeurs optionnels pour la vision et l'audio.
- Optimisation du stockage et de la mémoire À l'aide de l'apprentissage par représentation Matryoshka, les développeurs peuvent tronquer les vecteurs de sortie pour réduire le stockage jusqu'à 6 fois. Avec la quantification sur un Google Pixel 11 Pro, il nécessite environ 191 Mo de RAM active pour les poids textuels seuls et environ 567 Mo pour le modèle multimodal complet.
- Fenêtre de contexte élargie Le modèle dispose d'une fenêtre de contexte de 8K jetons, soit quatre fois plus grande que la version précédente, lui permettant de traiter jusqu'à 5,5 minutes d'audio, 29 images, 58 images vidéo ou des combinaisons mixtes sur du matériel local.
- Scores de performance améliorés Il offre une amélioration de 9,92 points des performances de code dans MTEB Code, passant de 68,76 à 78,68, et égale les performances textuelles multilingues solides tout en surpassant certains modèles spécialisés deux fois plus grands que lui.
Termes expliqués
- Modèle d'incorporation — Un type d'outil d'intelligence artificielle qui traduit différents types de données, tels que des mots ou des images, en chiffres afin que les ordinateurs puissent comprendre comment les informations se rapportent les unes aux autres. Exemple: Trier un album photo numérique en fonction de ce qui se trouve à l'intérieur des images pour retrouver facilement toutes les photos d'une plage.
- Multimodal — Qualifie un système d'intelligence artificielle capable de traiter et de comprendre plusieurs types de médias en même temps, tels que le texte, l'audio et la vidéo. Exemple: Une application qui vous permet de prononcer une phrase à voix haute pour trouver une scène correspondante dans un film.
- Paramètres — Les réglages internes ajustables à l'intérieur d'un modèle d'intelligence artificielle qui l'aident à apprendre des motifs et à faire des prédictions. Exemple: Tourner les boutons d'une table de mixage pour obtenir l'équilibre parfait entre la voix et la musique.
- Quantification — Une technique utilisée pour réduire la taille d'un modèle d'intelligence artificielle afin qu'il occupe moins de mémoire et s'exécute plus rapidement sur des appareils ordinaires. Exemple: Compresser un fichier photo numérique volumineux dans un format plus petit pour qu'il occupe moins d'espace sur votre téléphone.
- Fenêtre de contexte — La quantité d'informations ou de données qu'un modèle d'intelligence artificielle peut examiner et traiter en une seule fois. Exemple: Lire un seul chapitre d'un livre à la fois au lieu de parcourir tout le livre page par page.
Pourquoi c'est important
EmbeddingGemma 2 aide les développeurs à créer des outils de recherche et des applications hors ligne qui s'exécutent localement sur du matériel grand public. Cela garantit la confidentialité des données des utilisateurs sur l'appareil, fonctionne sans connexion Internet et réduit la latence pour les tâches quotidiennes telles que la recherche dans des bases de code locales ou des bibliothèques multimédias personnelles.
Ce que l'on ne sait pas encore
La source ne fournit pas de détails complets sur chaque cas d'utilisation réel possible ou sur les résultats de performance à long terme sur tous les appareils grand public. La disponibilité dans le Gemini Enterprise Agent Platform Model Garden arrivera bientôt plutôt que d'être immédiate.
D'après un article de Google DeepMind. Ceci est une explication indépendante, rédigée avec nos propres mots et l'aide d'une IA ; Google DeepMind ne l'a ni relue ni approuvée. Consultez l'original pour tous les détails.