Sumário

LLaMA (Large Language Model Meta AI) é uma coleção de modelos de linguagem abertos da Meta que variam de 7B a 65B parâmetros, treinados em trilhões de tokens com dados publicamente disponíveis. O LLaMA-13B supera o GPT-3 (175B) em vários benchmarks apesar de ser 10x menor.

Capacidades (confidence: high)

  • LLaMA-13B supera GPT-3(175B) em muitos benchmarks com apenas uma GPU
  • LLaMA-65B é competitivo com Chinchilla-70B e PaLM-540B
  • Modelos menores treinados em mais dados alcançam melhor desempenho (Hoffman et al. 2022)
  • Código aberto disponível em github.com/facebookresearch/llama

Implicações

O LLaMA inaugurou uma geração de modelos abertos eficientes e inspirou derivados como Alpaca, Vicuna e code-llama, além de influenciar diretamente o llama-3.

llm-models-guide | prompt-engineering-guide | dair-ai

Sources

  • raw/prompts/articles/promptingguide-pt-models-llama.md