Sumário

Llama 3 é a terceira geração da família de modelos da Meta, disponível nos tamanhos 8B e 70B parâmetros (pré-treinados e ajustados por instrução), com um modelo adicional de 400B em treinamento.

Capacidades (confidence: high)

  • Vocabulário de 128K tokens, treinado em sequências de 8K tokens
  • Usa Grouped Query Attention (GQA)
  • Pré-treinado em mais de 15T tokens
  • Pós-treinamento combina SFT, rejection sampling, PPO e DPO
  • Llama 3 8B supera gemma 7B e mistral-7b Instruct
  • Llama 3 70B supera Gemini Pro 1.5 e claude-3 Sonnet

llm-models-guide | llama | prompt-engineering-techniques

Sources

  • raw/prompts/articles/promptingguide-pt-models-llama-3.md