
Google DeepMind presentou EmbeddingGemma 2, un modelo aberto de 740 millóns de parámetros capaz de representar texto, código, imaxes, audio e vídeo nun mesmo espazo vectorial. O modelo está orientado á busca semántica, á recuperación de información e a sistemas RAG que poden funcionar directamente no dispositivo, sen enviar os datos á nube, e distribúese baixo licenza Apache 2.0.
O modelo permite realizar buscas cruzadas entre diferentes tipos de contido. Así, unha consulta de texto pode servir para localizar un momento concreto nun vídeo ou unha gravación de audio, mentres que unha imaxe pode utilizarse para atopar contidos semellantes nunha biblioteca multimedia. Google xa incorporou estas posibilidades ás ferramentas Instant Media Search e Video Moments Finder de Google AI Edge.
EmbeddingGemma 2 está baseado na arquitectura de Gemma 4 e conta cun deseño modular. A versión para tarefas de texto pode funcionar con 270 millóns de parámetros, mentres que os codificadores opcionais de visión e audio engaden 170 e 300 millóns, respectivamente. O modelo admite un contexto de ata 8.000 tokens, suficiente para procesar localmente ata 5,5 minutos de audio, 29 imaxes ou 58 fotogramas de vídeo.
A eficiencia é unha das prioridades do deseño. A técnica Matryoshka Representation Learning permite reducir os vectores de saída de 768 a 512, 256 ou 128 dimensións, cunha redución de ata seis veces no almacenamento necesario para as bases de datos vectoriais. Nun Pixel 11 Pro e coa cuantización aplicada, Google sitúa o consumo activo de RAM en aproximadamente 191 MB para a configuración textual e 567 MB para a multimodal.
As prestacións tamén melloran respecto da primeira xeración en tarefas de programación. En MTEB Code, EmbeddingGemma 2 obtén 78,68 puntos fronte aos 68,76 de EmbeddingGemma, o que reforza o seu uso en indexación de código, busca semántica e recuperación de información para axentes de programación. Google destaca tamén o seu rendemento en tarefas de visión e audio fronte a outros modelos multimodais de menos de 1.000 millóns de parámetros.
A execución local permite reducir a latencia e manter os datos no dispositivo, ademais de facilitar o funcionamento sen conexión. Combinado con Gemma 4, o modelo pode empregarse para crear sistemas RAG multimodais que recuperen información localmente e posteriormente utilicen un modelo xerativo para analizala.
EmbeddingGemma 2 xa se pode descargar desde Hugging Face e Kaggle. O modelo é compatible con MediaPipe e LiteRT para o desenvolvemento en dispositivos, así como con ferramentas como Transformers, Sentence Transformers, MLX, vLLM, llama.cpp, SGLang, Ollama e LM Studio.

