Question

Quais modelos — incluindo Claude, Gemini e GPT — são os melhores para operar um LLM Wiki (ingest, query, lint), e como as alternativas abertas e locais se comparam?

Ranking Criteria

  • Capacidade de ingest — síntese, julgamento de quais páginas criar, aderência ao schema
  • Capacidade de query — síntese a partir de conteúdo já compilado
  • Capacidade de lint — julgamento semântico residual sobre regras majoritariamente determinísticas
  • Disponibilidade — fronteira fechada vs aberta vs local/privacidade
  • Ecossistema de agente — Skills, MCP, subagentes, hooks; claude-code é a referência de maturidade

O vault não contém benchmarks diretos modelo-vs-modelo para operações de wiki. O ranking abaixo combina (a) evidência vault, (b) evidência externa rotulada como tal, e (c) inferência explicitamente marcada.

Found / Analyzed

Found: 14 famílias de modelos mencionadas nas fontes do vault e nas capturas/referências externas. Analyzed: 14 para o ranking.

Famílias identificadas: Claude, GPT (OpenAI), Gemini (Google), Fable, Qwen, Gemma, Llama, Phi, DeepSeek, Mistral, GLM, Kimi, Nemotron, OLMo.

Ranking

Tier 1 — Fronteira agentic com ecossistema maduro

ModeloForçaEvidênciaConfiança
Claude Sonnet / Opus (via claude-code)Ecossistema mais maduro — Skills, MCP, subagentes, hooks; padrão de facto do ecossistema LLM Wiki (Karpathy, rohitg00, nashsu 14.3k⭐, claude-obsidian 9.2k⭐)vault, alta ^[raw/articles/llm-wiki-okf-comprehensive-report-2026.md]alta
Qwen 3.6 27B / Plus1M de contexto; melhor coder denso (77.2% SWE-bench)externamédia
DeepSeek V483.7% SWE-bench; licença MITexternamédia
Gemini (2.5 / 3.x)1M de contexto; forte em código; mesma família do Gemma abertoinferência — nenhuma evidência no vaultbaixa
GPT (OpenAI, o-series / GPT-5)Capaz como agente genérico; ausente do ecossistema LLM Wiki no vaultinferência — nenhuma evidência no vaultbaixa

Tier 2 — Aberto competitivo e local single-GPU

ModeloForçaEvidênciaConfiança
Qwen 3-30B-A3BMelhor relação custo/qualidade em GPU única; Apache 2.0externamédia
Gemma 4 (26B-A4B / 31B)Roda local em laptop; privacidade total; mesma família Geminiexterna + repos locaismédia
Mistral Small 3.1 24B / Devstral 24BTool-calling agentic; Apache 2.0externamédia
Llama 4 Scout10M de contexto; licença customizada Metaexternamédia

Tier 3 — Pequenos locais via Ollama (provados em implementações LLM Wiki)

ModeloForçaEvidência
qwen2.5:14bEscrita de páginas; rápido em laptoprepo kytmanov/obsidian-llm-wiki-local (externa)
llama3.1:8bEscrita de páginas; rápido em laptoprepo kytmanov/obsidian-llm-wiki-local (externa)
phi4-miniInferência veloz para triagem/capturarepo kytmanov/obsidian-llm-wiki-local (externa)
gemma4:e4bInferência veloz para triagem/capturarepo kytmanov/obsidian-llm-wiki-local (externa)

O qmd roda um pipeline de três modelos totalmente local, sem chamadas a APIs de LLM — prova de que a operação de wiki é viável sem modelos frontier, embora o vault não divulgue os nomes. ^[raw/repositories/swarmvault-github.md] e o llm-wiki-agent de SamurAIGPT (3.2k⭐) suportam múltiplos modelos explicitamente.

Tier especial — overkill ou nicho

ModeloObservação
FableAberto, mas overkill para ingest — Nate troca para Opus nas demos ^[raw/transcripts/sozai-fable-llm-wiki-video.md]
DeepSeek-OCR-2Especialista em OCR, não em operação de wiki
Nemotron 3, GLM 5.1, Kimi K2.6, OLMoMencionados em rankings externos de julho/2026; sem evidência vault

Por Operação

  • ingest — onde o modelo mais importa (síntese, julgamento de páginas). Fronteira com bom schema: Claude é a escolha conservadora; Qwen/DeepSeek/Gemma locais são competitivos quando o schema é bem escrito. Fable é overkill.
  • query — infraestrutura de recuperação importa mais que o modelo. O index.md funciona até ~100–200 páginas; acima disso, busca híbrida (BM25 + vetor + grafo, 95.2% LongMemEval-S). Qualquer modelo competente sintetiza o mesmo conteúdo compilado.
  • lint — majoritariamente determinístico (wikilint Go CLI: órfãos, links quebrados, frontmatter, taxonomia). O LLM entra só no julgamento semântico residual; qualquer modelo capaz basta.

Conclusão

  • Padrão de facto: Claude Sonnet/Opus via claude-code — ecossistema mais maduro e onde o ecossistema LLM Wiki converge.
  • Alternativa aberta mais forte em julho/2026: Qwen 3.6 / 3-30B-A3B e DeepSeek V4 (evidência externa).
  • Privacidade total: Gemma 4, Qwen local e Llama via Ollama — já comprovados em repos de LLM Wiki locais.
  • Gemini e GPT: capazes por inferência, mas sem nenhuma evidência no vault de adoção no ecossistema LLM Wiki.
  • O schema importa mais que o modelo: modelos frontier perdem acurácia quando o schema passa de ~200 linhas; regras claras + frontmatter OKF + wikilinks + invariante de composição transformam qualquer LLM competente em um operador disciplinado.

Por operação, a necessidade de modelo decresce ingest > query > lint — mesma conclusão de modelo-ideal-para-ingest.

Open Questions

  • O Mistral Small 4 (2026-03-16, 119B MoE, 256K ctx, Apache 2.0) — sucessor que unifica reasoning/visão/agentic e supera o Small 3.1 24B em capacidade — muda este ranking Tier 2? Requer self-host multi-GPU e sem evidência de operação de wiki; ver mistral-small-3-1-24b-vs-mistral-small-4.
  • Quanto da diferença entre Claude Sonnet e Opus é real para ingest com um schema bem escrito?
  • Modelos locais (Gemma 4, Qwen 30B-A3B) atingem a mesma qualidade de ingest que frontier em um vault pequeno?
  • Alguma evidência futura coloca Gemini ou GPT como operadores reais de LLM Wiki no ecossistema? (Hoje: nenhuma no vault.)
  • Os nomes dos modelos do pipeline do qmd serão divulgados? (Três modelos, sem APIs.)

Sources

^[raw/articles/llm-wiki-okf-comprehensive-report-2026.md] ^[raw/transcripts/sozai-fable-llm-wiki-video.md] ^[raw/articles/llm-wiki-v2-rohitg00-2026.md] ^[raw/repositories/swarmvault-github.md] ^[wiki/entities/claude-code.md]

External References

Referências externas citadas acima — não são evidência capturada no vault (Guardrail #16). Viram evidência apenas após scripts/external_links.py capture gravar snapshot imutável em raw/external/.