Sumário
Mixtral 8x7B é um modelo da Mistral AI que usa arquitetura Mixture-of-Experts (MoE) com 8 especialistas de 7B cada, ativando apenas 2 por token. O artigo original do Prompt Engineering Guide aguarda tradução para português.
Capacidades (confidence: medium)
- Arquitetura MoE com 46.7B parâmetros totais, 12.9B ativos por token
- Supera llama 2 70B e GPT-3.5 em vários benchmarks
- Versão maior: mixtral-8x22b
llm-models-guide | mistral-7b | prompt-engineering-techniques
Sources
- raw/prompts/articles/promptingguide-pt-models-mixtral.md