O T5Gemma 2 é mais do que uma simples atualização; ele traz mudanças arquitetônicas significativas e herda muitos dos recursos poderosos da família Gemma 3. Este modelo é a primeira versão multimodal e com longas janelas de contexto da linha de modelos encoder-decoder.
Diferente do T5Gemma, o T5Gemma 2 utiliza embeddings amarrados entre o encoder e o decoder, além de um mecanismo de atenção unificada que combina atenção própria e cruzada, otimizando o uso de parâmetros. Os modelos compactos têm tamanhos de 270M-270M (cerca de 370M no total, sem contar o encoder de visão), 1B-1B (cerca de 1,7B) e 4B-4B (cerca de 7B) de parâmetros, tornando-os ideais para experimentação rápida e aplicações em dispositivos.
Contexto
No T5Gemma original, foi demonstrado que modelos modernos de decoder único poderiam ser adaptados para uma arquitetura encoder-decoder, aumentando assim a versatilidade. Ao iniciar com pesos de um modelo de decoder potente e aplicar um pré-treinamento contínuo, conseguimos criar modelos de alta qualidade e eficiência de inferência, evitando os altos custos computacionais de um treinamento completo.
O T5Gemma 2 avança essa ideia ao integrar inovações da Gemma 3 no campo dos modelos de linguagem-visual.
Novidades
O T5Gemma 2 vai além de um simples re-treinamento. Ele incorpora inovações arquitetônicas significativas enquanto herda recursos avançados da família Gemma 3.
Inovações Arquitetônicas para Eficiência
Para maximizar a eficiência em escalas menores, introduzimos refinamentos estruturais:
- Embeddings Amarrados: Agora utilizamos embeddings amarrados entre o encoder e o decoder, o que reduz significativamente o número total de parâmetros, permitindo incorporar mais capacidades ativas na mesma memória — essencial para o novo modelo compacto de 270M-270M.
- Atenção Unificada: No decoder, adotamos um mecanismo de atenção unificada, mesclando atenção própria e cruzada em uma única camada de atenção. Isso reduz a complexidade arquitetônica, melhora a paralelização do modelo e beneficia a inferência.
Capacidades de Próxima Geração
Inspirado pela Gemma 3, o T5Gemma 2 representa uma atualização significativa nas capacidades do modelo:
- Multimodalidade: Os modelos T5Gemma 2 compreendem e processam imagens juntamente com texto, utilizando um encoder de visão altamente eficiente para realizar tarefas de resposta a perguntas visuais e raciocínio multimodal.
- Contexto Longo Estendido: Ampliamos drasticamente a janela de contexto, permitindo que o T5Gemma 2 lide com janelas de contexto de até 128K tokens, aproveitando o mecanismo de atenção local e global alternado da Gemma 3.
- Multilinguismo Amplo: Treinados em um conjunto de dados maior e mais diverso, esses modelos agora suportam mais de 140 idiomas desde o início.
Desempenho
O T5Gemma 2 estabelece um novo padrão para o que modelos compactos encoder-decoder podem alcançar, demonstrando desempenho forte em áreas-chave, herdando as características multimodais e de longo contexto da arquitetura Gemma 3.
O T5Gemma 2 oferece um desempenho multimodal robusto, superando a Gemma 3 em vários benchmarks. Adaptamos modelos base de texto apenas da Gemma 3 (270M e 1B) para criar modelos encoder-decoder multimodais eficazes. Além disso, ele apresenta uma capacidade de longo contexto superior, com ganhos significativos em qualidade em relação à Gemma 3 e T5Gemma. Utilizando um encoder separado, o T5Gemma 2 é mais eficiente em lidar com problemas de longo contexto. Em tarefas de codificação, raciocínio e multilinguismo, o T5Gemma 2, em geral, supera seu equivalente da Gemma 3.
Estamos ansiosos para ver o que a comunidade criará com o T5Gemma 2. Esta versão inclui checkpoints pré-treinados, projetados para serem ajustados por desenvolvedores para tarefas específicas antes da implantação.
Esses checkpoints pré-treinados já estão disponíveis para uso amplo em várias plataformas:
- Leia o artigo no arXiv
- Baixe no Kaggle
- Disponível no Hugging Face
- Explore via Colab
- Execute inferência via Vertex AI



