EmbeddingGemma 2 lleva al dispositivo la búsqueda en grabaciones, documentos y video

Google lanzó EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que indexa texto, código, imágenes, audio y video en un mismo espacio para búsqueda y RAG sin conexión.

Google presentó el 6 de octubre de 2026 EmbeddingGemma 2, un modelo abierto de embeddings que mapea combinaciones de texto, código, imágenes, audio y video en un espacio de representación único y funciona en el propio dispositivo. ## Datos clave - 740 millones de parámetros, construido sobre la arquitectura Gemma 4 y publicado con licencia Apache 2.0. - Su antecesor, EmbeddingGemma, superó 20 millones de descargas, según Google. - Mantiene el rendimiento multilingüe en texto de la versión anterior y sube de 68.76 a 78.68 puntos en MTEB Code (+9.92). - Comparte tokenizador de texto y codificador de audio con Gemma 4, lo que permite ejecutar ambos modelos en un mismo pipeline con menor huella de memoria. - Con cuantización, en un Google Pixel 11 Pro requiere unos 191 MB de RAM activa para texto y unos 567 MB para el modelo multimodal completo, según 9to5Google. - Pesos disponibles en Hugging Face y Kaggle. ## Casos de uso que Google demuestra - Encontrar un clip de video a partir de una nota de voz, o buscar en horas de grabaciones de audio con una consulta de texto. - Búsqueda semántica en bibliotecas de medios (Instant Media Search) y localización de momentos en video (Video Moments Finder), dentro de Google AI Edge Gallery. - Google AI Edge Foresight, una app para Mac que combina EmbeddingGemma 2 para recuperar archivos locales con Gemma 4 para razonar sobre ellos y convertir apuntes en notas completas a partir de grabaciones sin conexión. ## Lo relevante para la memoria organizacional Buena parte del conocimiento de una organización vive en reuniones grabadas, presentaciones y archivos dispersos. Un modelo que indexa ese material de forma local y multimodal reduce el costo de recuperarlo sin enviarlo a servicios externos, uno de los frenos habituales para documentar y reutilizar lo que ya se sabe. Fuentes: Google, "EmbeddingGemma 2: an open, lightweight multimodal embedding model" (6 oct 2026) — https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ ; 9to5Google (6 oct 2026) — https://9to5google.com/2026/10/06/google-ai-edge-foresight/