Sumário

Gemma é uma série de modelos abertos do Google DeepMind (2B e 7B parâmetros), inspirados na mesma pesquisa e tecnologia usada para criar gemini. Geralmente supera llama 2 7B e mistral-7b em benchmarks.

Capacidades (confidence: high)

  • Modelo 7B treinado em 6T tokens, modelo 2B treinado em 2T tokens
  • Arquitetura transformer decoder com atenção multi-query (2B) e multi-head (7B)
  • Embeddings RoPE, ativações GeGLU, vocabulário de 256K tokens (SentencePiece)
  • Janela de contexto de 8192 tokens
  • Ajuste instrucional com SFT + RLHF
  • Supera Llama 2 7B e Mistral 7B em HumanEval, GSM8K, MATH e AGIEval

Implicações

A Gemma representou a entrada do Google no mercado de modelos abertos, competindo diretamente com llama-3 e mistral-7b.

llm-models-guide | prompt-engineering-techniques | dair-ai

Sources

  • raw/prompts/articles/promptingguide-pt-models-gemma.md