Sumário
LLaMA (Large Language Model Meta AI) é uma coleção de modelos de linguagem abertos da Meta que variam de 7B a 65B parâmetros, treinados em trilhões de tokens com dados publicamente disponíveis. O LLaMA-13B supera o GPT-3 (175B) em vários benchmarks apesar de ser 10x menor.
Capacidades (confidence: high)
- LLaMA-13B supera GPT-3(175B) em muitos benchmarks com apenas uma GPU
- LLaMA-65B é competitivo com Chinchilla-70B e PaLM-540B
- Modelos menores treinados em mais dados alcançam melhor desempenho (Hoffman et al. 2022)
- Código aberto disponível em github.com/facebookresearch/llama
Implicações
O LLaMA inaugurou uma geração de modelos abertos eficientes e inspirou derivados como Alpaca, Vicuna e code-llama, além de influenciar diretamente o llama-3.
llm-models-guide | prompt-engineering-guide | dair-ai
Sources
- raw/prompts/articles/promptingguide-pt-models-llama.md