Sumário
Gemma é uma série de modelos abertos do Google DeepMind (2B e 7B parâmetros), inspirados na mesma pesquisa e tecnologia usada para criar gemini. Geralmente supera llama 2 7B e mistral-7b em benchmarks.
Capacidades (confidence: high)
- Modelo 7B treinado em 6T tokens, modelo 2B treinado em 2T tokens
- Arquitetura transformer decoder com atenção multi-query (2B) e multi-head (7B)
- Embeddings RoPE, ativações GeGLU, vocabulário de 256K tokens (SentencePiece)
- Janela de contexto de 8192 tokens
- Ajuste instrucional com SFT + RLHF
- Supera Llama 2 7B e Mistral 7B em HumanEval, GSM8K, MATH e AGIEval
Implicações
A Gemma representou a entrada do Google no mercado de modelos abertos, competindo diretamente com llama-3 e mistral-7b.
llm-models-guide | prompt-engineering-techniques | dair-ai
Sources
- raw/prompts/articles/promptingguide-pt-models-gemma.md