Question

Mistral Small 3.1 24B é melhor que os modelos “Mistral 4”?

Answer

Route: main

Found: 2 candidatos (Mistral Small 3.1 24B, Mistral Small 4). Analyzed: 2.

“Mistral 4” é o nome de arquitetura no HuggingFace Transformers; a liberação real é Mistral Small 4 (Mistral-Small-4-119B-2603, 2026-03-16). O nome não aparece em nenhuma página do vault — é candidato exclusivamente externo.

Veredito: não. Na capacidade bruta, o Mistral Small 4 supera o Mistral Small 3.1 24B por larga margem — é o sucessor e uma classe de arquitetura diferente. O Small 3.1 24B vence apenas o nicho de deploy single-GPU/local (RTX 4090 24GB / Mac 32GB), e é o único dos dois com evidência de ranking no vault para operação de wiki.

DimensãoSmall 3.1 24B (2025-03-17)Small 4 (2026-03-16)
Arquitetura24B denso119B MoE (128 experts, 6.5B ativos)
Contexto128K256K
Envelopetexto + visãoUnifica Instruct + Reasoning (ex-Magistral) + agentic (ex-Devstral) + visão (ex-Pixtral); reasoning effort configurável
GPQA Diamond45.96%71.2% (modo reasoning)
MMLU80.62%88.5%
MMLU-Pro66.76%78.0%
HumanEval88.41%92%
LicençaApache 2.0Apache 2.0
Deploy local1× RTX 4090 / Mac 32GBmulti-GPU (119B de pesos)
Velocidade~150 tok/s157.8 tok/s; 3× throughput vs Small 3

Nuances importantes:

  • Modo reasoning importa: o modo non-reasoning do Small 4 é bem mais fraco (GPQA 57.1% vs 71.2% com reasoning). Para triagem rápida single-shot, a distância para o Small 3.1 encolhe bastante.
  • Sem evidência direta de operação de wiki para nenhum dos dois: o rank-modelos-operacao-wiki afirma explicitamente que o vault “não contém benchmarks diretos modelo-vs-modelo para operações de wiki”. Por inferência o Small 4 (raciocinador mais forte) seria provavelmente melhor em ingest, mas com custo de deploy maior e sem nenhuma evidência de ecossistema.

Evidence Levels

  • Mistral Small 4: sem evidência no vault — candidato exclusivamente externo (ver critério de rota acima).
  • Evidência vault (média): rank-modelos-operacao-wiki classifica Mistral Small 3.1 24B / Devstral 24B como Tier 2 (tool-calling agentic; Apache 2.0; evidência externa; confiança média) para operar a wiki.
  • Evidência externa (rótulo externo, 2026-03/05): números de benchmark do Small 4 são do anúncio oficial da Mistral (blog + HF model card) e reviews independentes (ChatForest, emelia.io). Vários são auto-reportados pelo vendor (ex. HumanEval 92%).
  • Inferência (marcada): a qualidade do Small 4 para ingest/query/lint de wiki é não-verificada — requer self-host multi-GPU e não tem evidência de adoção no ecossistema LLM Wiki.
  • rank-modelos-operacao-wiki — ranking de modelos para operar a wiki onde Small 3.1 24B aparece (Tier 2) e Small 4 ainda não existe
  • llm-wiki — contexto de por que a comparação importa (operações de ingest/query/lint)

Sources

External References

Referências externas citadas acima — não são evidência capturada no vault (Guardrail #16). Viram evidência apenas após scripts/external_links.py capture gravar snapshot imutável em raw/external/. Todas abaixo estão com captura pendente.

External não verificada: https://mistral.ai/news/mistral-small-4/ — anúncio oficial do Mistral Small 4 (captura pendente) External não verificada: https://huggingface.co/mistralai/Mistral-Small-4-119B-2603 — model card e benchmarks (captura pendente) External não verificada: https://huggingface.co/mistralai/Mistral-Small-3.1-24B-Instruct-2503 — model card do Small 3.1 (captura pendente) External não verificada: https://chatforest.com/reviews/mistral-small-4-119b-moe-reasoning-vision-coding-llm-review/ — review independente com tabela comparativa (captura pendente) External não verificada: https://emelia.io/hub/mistral-small-4-complete-guide-benchmarks — guia comparativo 2026 (captura pendente) External não verificada: https://easy-benchmarks.com/models/mistral-small-4-non-reasoning — benchmark do modo non-reasoning (captura pendente)