Google DeepMind lança EmbeddingGemma 2 com 740 milhões de parâmetros
Modelo aberto reúne texto, áudio e vídeo em espaço vetorial comum e roda direto em notebooks e celulares.
Edição: Anderson Gomes
· 3 min de leitura

O Google DeepMind lançou em 14 de setembro de 2026 o EmbeddingGemma 2, um modelo aberto de 740 milhões de parâmetros que projeta texto, código, imagem, áudio e vídeo em um mesmo espaço vetorial de 768 dimensões. O sistema supera a versão anterior em cerca de 14% em tarefas de código e unifica quatro modalidades de dados em uma janela de contexto de 8.192 tokens, capaz de processar minutos de áudio ou vídeo contínuos. Quem constrói mecanismos de busca semântica, classificação e recuperação aumentada de informações (RAG) ganha uma alternativa para operar diretamente no hardware do usuário sem recorrer a serviços remotos. O modelo funciona direto no aparelho.
A equipe técnica baseou o projeto nas melhorias estruturais do Gemma 4 para realizar a extração multimodal de características em 24 camadas. A arquitetura divide a carga entre um núcleo textual de 270 milhões de parâmetros — com 130 milhões no transformer e 140 milhões no módulo de embedding — e codificadores modulares de visão, com 170 milhões, e de áudio, com 300 milhões. O modelo adota atenção mista GQA e MQA com janela deslizante de 1.024 tokens, ativação Gated FFN com GELU, vocabulário de 262.144 termos e projeção linear de 512 para 768 dimensões com pooling médio. Um único arquivo safetensors guarda os pesos.
Módulos desacoplados rodam no notebook sem exigir datacenter
Essa estrutura modular permite carregar na memória de trabalho apenas os codificadores exigidos pela tarefa do momento. Quem programa aplicações restritas a texto pode desativar os módulos de 170 milhões e 300 milhões de parâmetros, executando somente a espinha dorsal de 270 milhões em notebooks ou celulares comuns. Além disso, o suporte nativo a Matryoshka Representation Learning permite truncar os vetores de saída de 768 para 512, 256 ou 128 dimensões com perda mínima de precisão, sendo o menor tamanho ideal para cargas puramente textuais. O corte barateia o armazenamento em seis vezes.
Nas avaliações oficiais com precisão total a 768 dimensões, o modelo cravou 61,36 pontos médios no MTEB multilíngue v2 e avançou de 68,76 para 78,68 pontos no índice de código em relação ao EmbeddingGemma 1. Nos testes visuais, o sistema atingiu 64,64 no benchmark MIEB lite, 57,28 na prova de imagens do MMEB v2 e 67,84 na leitura de documentos visuais. A captação sonora registrou 69,54 pontos no MSEB para recuperação e 49,39 no MAEB, enquanto o teste de vídeo fechou em 50,67. Instruções curtas em texto otimizam as tarefas.
Licença Apache 2.0 libera produto comercial com pesos abertos
Publicado sob licença Apache 2.0 e integrado à biblioteca transformers, o projeto autoriza a exploração comercial irrestrita e a modificação de código sem cobrança de licença ou royalties. Essa liberdade transforma o cenário de quem desenvolve tecnologia no Brasil, onde a dependência de APIs cobradas em moeda estrangeira eleva os custos de produtos inteligentes. Com suporte comprovado a mais de 100 idiomas e operação local, pequenas equipes conseguem indexar bases corporativas em português sem enviar documentos sigilosos para fora da rede interna da empresa. Os pesos abertos aceleram a produção independente.
- apache-2.0
- feature-extraction
- transformers
- Modelos e LLMs
- HuggingFace Models
Fonte: Página do modelo no Hugging Face · Como produzimos as matérias
Qwen3.8 converge 18 pontos com GPT-5.5 Pro após injeção de raciocínio
Experimento do pesquisador wsxiaoys insere tokens de pensamento da OpenAI em modelos abertos e expõe pistas de destilação.
· 3 min de leitura

Desvio no chip Apple M3 eleva taxa do Llama de 10 para 24 tokens/s
· 3 min de leitura
DeepSeek lança modelo multimodal de 552 bilhões de parâmetros com licença MIT
Arquitetura comprime cache de memória em quatro vezes e ativa só 8 bilhões de parâmetros na leitura para cortar custo de infraestrutura.
· 3 min de leitura

OpenAI lança ChatGPT para bancos com GPT-6 Astra e dados de mercado
· 3 min de leitura