Question
Mistral Small 3.1 24B é melhor que os modelos “Mistral 4”?
Answer
Route: main
Found: 2 candidatos (Mistral Small 3.1 24B, Mistral Small 4). Analyzed: 2.
“Mistral 4” é o nome de arquitetura no HuggingFace Transformers; a liberação real é Mistral Small 4 (Mistral-Small-4-119B-2603, 2026-03-16). O nome não aparece em nenhuma página do vault — é candidato exclusivamente externo.
Veredito: não. Na capacidade bruta, o Mistral Small 4 supera o Mistral Small 3.1 24B por larga margem — é o sucessor e uma classe de arquitetura diferente. O Small 3.1 24B vence apenas o nicho de deploy single-GPU/local (RTX 4090 24GB / Mac 32GB), e é o único dos dois com evidência de ranking no vault para operação de wiki.
| Dimensão | Small 3.1 24B (2025-03-17) | Small 4 (2026-03-16) |
|---|---|---|
| Arquitetura | 24B denso | 119B MoE (128 experts, 6.5B ativos) |
| Contexto | 128K | 256K |
| Envelope | texto + visão | Unifica Instruct + Reasoning (ex-Magistral) + agentic (ex-Devstral) + visão (ex-Pixtral); reasoning effort configurável |
| GPQA Diamond | 45.96% | 71.2% (modo reasoning) |
| MMLU | 80.62% | 88.5% |
| MMLU-Pro | 66.76% | 78.0% |
| HumanEval | 88.41% | 92% |
| Licença | Apache 2.0 | Apache 2.0 |
| Deploy local | 1× RTX 4090 / Mac 32GB | multi-GPU (119B de pesos) |
| Velocidade | ~150 tok/s | 157.8 tok/s; 3× throughput vs Small 3 |
Nuances importantes:
- Modo reasoning importa: o modo non-reasoning do Small 4 é bem mais fraco (GPQA 57.1% vs 71.2% com reasoning). Para triagem rápida single-shot, a distância para o Small 3.1 encolhe bastante.
- Sem evidência direta de operação de wiki para nenhum dos dois: o rank-modelos-operacao-wiki afirma explicitamente que o vault “não contém benchmarks diretos modelo-vs-modelo para operações de wiki”. Por inferência o Small 4 (raciocinador mais forte) seria provavelmente melhor em ingest, mas com custo de deploy maior e sem nenhuma evidência de ecossistema.
Evidence Levels
- Mistral Small 4: sem evidência no vault — candidato exclusivamente externo (ver critério de rota acima).
- Evidência vault (média): rank-modelos-operacao-wiki classifica Mistral Small 3.1 24B / Devstral 24B como Tier 2 (tool-calling agentic; Apache 2.0; evidência externa; confiança média) para operar a wiki.
- Evidência externa (rótulo externo, 2026-03/05): números de benchmark do Small 4 são do anúncio oficial da Mistral (blog + HF model card) e reviews independentes (ChatForest, emelia.io). Vários são auto-reportados pelo vendor (ex. HumanEval 92%).
- Inferência (marcada): a qualidade do Small 4 para ingest/query/lint de wiki é não-verificada — requer self-host multi-GPU e não tem evidência de adoção no ecossistema LLM Wiki.
Related
- rank-modelos-operacao-wiki — ranking de modelos para operar a wiki onde Small 3.1 24B aparece (Tier 2) e Small 4 ainda não existe
- llm-wiki — contexto de por que a comparação importa (operações de ingest/query/lint)
Sources
External References
Referências externas citadas acima — não são evidência capturada no vault (Guardrail #16). Viram evidência apenas após
scripts/external_links.py capturegravar snapshot imutável emraw/external/. Todas abaixo estão com captura pendente.
External não verificada: https://mistral.ai/news/mistral-small-4/ — anúncio oficial do Mistral Small 4 (captura pendente) External não verificada: https://huggingface.co/mistralai/Mistral-Small-4-119B-2603 — model card e benchmarks (captura pendente) External não verificada: https://huggingface.co/mistralai/Mistral-Small-3.1-24B-Instruct-2503 — model card do Small 3.1 (captura pendente) External não verificada: https://chatforest.com/reviews/mistral-small-4-119b-moe-reasoning-vision-coding-llm-review/ — review independente com tabela comparativa (captura pendente) External não verificada: https://emelia.io/hub/mistral-small-4-complete-guide-benchmarks — guia comparativo 2026 (captura pendente) External não verificada: https://easy-benchmarks.com/models/mistral-small-4-non-reasoning — benchmark do modo non-reasoning (captura pendente)