Question
Quais modelos — incluindo Claude, Gemini e GPT — são os melhores para operar um LLM Wiki (ingest, query, lint), e como as alternativas abertas e locais se comparam?
Ranking Criteria
- Capacidade de ingest — síntese, julgamento de quais páginas criar, aderência ao schema
- Capacidade de query — síntese a partir de conteúdo já compilado
- Capacidade de lint — julgamento semântico residual sobre regras majoritariamente determinísticas
- Disponibilidade — fronteira fechada vs aberta vs local/privacidade
- Ecossistema de agente — Skills, MCP, subagentes, hooks; claude-code é a referência de maturidade
O vault não contém benchmarks diretos modelo-vs-modelo para operações de wiki. O ranking abaixo combina (a) evidência vault, (b) evidência externa rotulada como tal, e (c) inferência explicitamente marcada.
Found / Analyzed
Found: 14 famílias de modelos mencionadas nas fontes do vault e nas capturas/referências externas. Analyzed: 14 para o ranking.
Famílias identificadas: Claude, GPT (OpenAI), Gemini (Google), Fable, Qwen, Gemma, Llama, Phi, DeepSeek, Mistral, GLM, Kimi, Nemotron, OLMo.
Ranking
Tier 1 — Fronteira agentic com ecossistema maduro
| Modelo | Força | Evidência | Confiança |
|---|---|---|---|
| Claude Sonnet / Opus (via claude-code) | Ecossistema mais maduro — Skills, MCP, subagentes, hooks; padrão de facto do ecossistema LLM Wiki (Karpathy, rohitg00, nashsu 14.3k⭐, claude-obsidian 9.2k⭐) | vault, alta ^[raw/articles/llm-wiki-okf-comprehensive-report-2026.md] | alta |
| Qwen 3.6 27B / Plus | 1M de contexto; melhor coder denso (77.2% SWE-bench) | externa | média |
| DeepSeek V4 | 83.7% SWE-bench; licença MIT | externa | média |
| Gemini (2.5 / 3.x) | 1M de contexto; forte em código; mesma família do Gemma aberto | inferência — nenhuma evidência no vault | baixa |
| GPT (OpenAI, o-series / GPT-5) | Capaz como agente genérico; ausente do ecossistema LLM Wiki no vault | inferência — nenhuma evidência no vault | baixa |
Tier 2 — Aberto competitivo e local single-GPU
| Modelo | Força | Evidência | Confiança |
|---|---|---|---|
| Qwen 3-30B-A3B | Melhor relação custo/qualidade em GPU única; Apache 2.0 | externa | média |
| Gemma 4 (26B-A4B / 31B) | Roda local em laptop; privacidade total; mesma família Gemini | externa + repos locais | média |
| Mistral Small 3.1 24B / Devstral 24B | Tool-calling agentic; Apache 2.0 | externa | média |
| Llama 4 Scout | 10M de contexto; licença customizada Meta | externa | média |
Tier 3 — Pequenos locais via Ollama (provados em implementações LLM Wiki)
| Modelo | Força | Evidência |
|---|---|---|
| qwen2.5:14b | Escrita de páginas; rápido em laptop | repo kytmanov/obsidian-llm-wiki-local (externa) |
| llama3.1:8b | Escrita de páginas; rápido em laptop | repo kytmanov/obsidian-llm-wiki-local (externa) |
| phi4-mini | Inferência veloz para triagem/captura | repo kytmanov/obsidian-llm-wiki-local (externa) |
| gemma4:e4b | Inferência veloz para triagem/captura | repo kytmanov/obsidian-llm-wiki-local (externa) |
O qmd roda um pipeline de três modelos totalmente local, sem chamadas a APIs de LLM — prova de que a operação de wiki é viável sem modelos frontier, embora o vault não divulgue os nomes. ^[raw/repositories/swarmvault-github.md] e o llm-wiki-agent de SamurAIGPT (3.2k⭐) suportam múltiplos modelos explicitamente.
Tier especial — overkill ou nicho
| Modelo | Observação |
|---|---|
| Fable | Aberto, mas overkill para ingest — Nate troca para Opus nas demos ^[raw/transcripts/sozai-fable-llm-wiki-video.md] |
| DeepSeek-OCR-2 | Especialista em OCR, não em operação de wiki |
| Nemotron 3, GLM 5.1, Kimi K2.6, OLMo | Mencionados em rankings externos de julho/2026; sem evidência vault |
Por Operação
- ingest — onde o modelo mais importa (síntese, julgamento de páginas). Fronteira com bom schema: Claude é a escolha conservadora; Qwen/DeepSeek/Gemma locais são competitivos quando o schema é bem escrito. Fable é overkill.
- query — infraestrutura de recuperação importa mais que o modelo. O
index.mdfunciona até ~100–200 páginas; acima disso, busca híbrida (BM25 + vetor + grafo, 95.2% LongMemEval-S). Qualquer modelo competente sintetiza o mesmo conteúdo compilado. - lint — majoritariamente determinístico (wikilint Go CLI: órfãos, links quebrados, frontmatter, taxonomia). O LLM entra só no julgamento semântico residual; qualquer modelo capaz basta.
Conclusão
- Padrão de facto: Claude Sonnet/Opus via claude-code — ecossistema mais maduro e onde o ecossistema LLM Wiki converge.
- Alternativa aberta mais forte em julho/2026: Qwen 3.6 / 3-30B-A3B e DeepSeek V4 (evidência externa).
- Privacidade total: Gemma 4, Qwen local e Llama via Ollama — já comprovados em repos de LLM Wiki locais.
- Gemini e GPT: capazes por inferência, mas sem nenhuma evidência no vault de adoção no ecossistema LLM Wiki.
- O schema importa mais que o modelo: modelos frontier perdem acurácia quando o schema passa de ~200 linhas; regras claras + frontmatter OKF + wikilinks + invariante de composição transformam qualquer LLM competente em um operador disciplinado.
Por operação, a necessidade de modelo decresce ingest > query > lint — mesma conclusão de modelo-ideal-para-ingest.
Open Questions
- O Mistral Small 4 (2026-03-16, 119B MoE, 256K ctx, Apache 2.0) — sucessor que unifica reasoning/visão/agentic e supera o Small 3.1 24B em capacidade — muda este ranking Tier 2? Requer self-host multi-GPU e sem evidência de operação de wiki; ver mistral-small-3-1-24b-vs-mistral-small-4.
- Quanto da diferença entre Claude Sonnet e Opus é real para ingest com um schema bem escrito?
- Modelos locais (Gemma 4, Qwen 30B-A3B) atingem a mesma qualidade de ingest que frontier em um vault pequeno?
- Alguma evidência futura coloca Gemini ou GPT como operadores reais de LLM Wiki no ecossistema? (Hoje: nenhuma no vault.)
- Os nomes dos modelos do pipeline do qmd serão divulgados? (Três modelos, sem APIs.)
Sources
^[raw/articles/llm-wiki-okf-comprehensive-report-2026.md] ^[raw/transcripts/sozai-fable-llm-wiki-video.md] ^[raw/articles/llm-wiki-v2-rohitg00-2026.md] ^[raw/repositories/swarmvault-github.md] ^[wiki/entities/claude-code.md]
External References
Referências externas citadas acima — não são evidência capturada no vault (Guardrail #16). Viram evidência apenas após
scripts/external_links.py capturegravar snapshot imutável emraw/external/.
- https://github.com/DimitrisLianos/LLM_Wiki_SecondBrain — Gemma 4 26B-A4B, totalmente local (captura pendente)
- https://github.com/kytmanov/obsidian-llm-wiki-local — Ollama: gemma4:e4b/phi4-mini (triagem), qwen2.5:14b/llama3.1:8b (escrita); Groq/Together/LM Studio/vLLM flexíveis (captura pendente)
- https://github.com/pkcpkc/mycelium-mind — offline OKF, oMLX: Qwen3.6-35B-A3B + Gemma-4-31B + DeepSeek-OCR-2 (captura pendente)
- Rankings agregadores de julho/2026 (benchmarks de coder, não de wiki): promptquorum.com, toolhalla.ai, mindstudio.ai, presenc.ai, dreaming.press, layer3labs.io (captura pendente)