Superpowers vs Matt Pocock’s Skills

Entities Compared

  • superpowers — framework de disciplina imposta, pipeline obrigatório (~268k★)
  • matt-pocock-skills — toolkit composável, skills invocáveis manualmente (~208k★)

One-Line Positioning

Superpowers impõe disciplina ao agente (o sistema gerencia o workflow). Matt Pocock dá ferramentas ao humano (o operador decide quando disciplinar). A tese central do documento: não competem — são complementares, e a comunidade migrou de “um ou outro” para composição.

Dimensões comparadas

Filosofia

SuperpowersMatt Pocock
ModeloDisciplina imposta (pipeline automático)Toolset composável (invocação manual)
PresuposiçãoO agente precisa ser gerenciado como estagiárioO engenheiro sabe quando aplicar estrutura

Planejamento

SuperpowersMatt Pocock
AbordagemBlueprint formal: writing-plansexecuting-plans (docs/superpowers/plans/)Tickets vivos: to-tickets, to-spec, CONTEXT.md
Quando usarEspecificações de grande porte, upfront architectureProjetos dinâmicos, evolução incremental

TDD

SuperpowersMatt Pocock
CicloRED-GREEN-REFACTOR não-negociável (deleta código se pular)RED-GREEN com refatoração separada (seam-based testing)
Comunidade”TDD é a chave do sucesso” vs “refactor no loop é anti-pattern”Visto como mais alinhado com práticas contemporâneas

Subagentes

SuperpowersMatt Pocock
ArquiteturaLinear/assembly line — 1 subagente por tarefa em sequênciaParalelo/orquestra — 10+ agentes em worktrees isolados
RevisãoReview em cada etapa do pipelineGrilling e code-review via subagentes dedicados

Adoção e fricção

SuperpowersMatt Pocock
SentimentoBipolar (adores e detratores apaixonados)Consistentemente positivo (“just enough”)
Fricção inicialAlta (bootstrap frágil, confusão de onboard)Baixa (skills pequenas, composable)
Carga do operadorBaixa (pipeline roda sozinho)Alta (usuário invoca manualmente)
ContinuidadeFraca (sem cross-session roadmap)Razoável (/handoff, mas perde detalhes)

Padrões de integração (a síntese)

O documento não recomenda escolher um — recomenda compor. Três padrões emergem da prática:

  1. Design-Fusion: grill-with-docs (Matt) para alinhar requisitos → brainstorm (Superpowers) para gerar spec formal → writing-plans para plano executável.
  2. Execution-Enhancement: Superpowers executa o pipeline TDD → se falha, muda para /diagnosing-bugs (Matt) para investigação exploratória → volta ao Superpowers para verificação.
  3. Session-Handoff: /handoff (Matt) compacta o estado → executing-plans (Superpowers) retoma de checkpoint.

Regra crítica: nunca rodar ambos como rotas ativas no mesmo session — colisão de comandos (/review, /implement existem nos dois). Adotar abordagem de “estado-máquina” (transição consciente entre fases).

Mapa skill × skill (deep research)

DimensãoSuperpowers (obra)Matt Pocock (mattpocock)
Escala (08/07)~268.645★ / ~24k forks / 326 issues~208.547★ / ~18k forks / 302 issues
Skills14, auto-triggered38, manual /cmd + core
Designbrainstorming hard-gategrillingCONTEXT.md + ADRs
Spec/planwriting-plans + executing-plansto-spec + to-tickets (tracer bullets)
TDDRED-GREEN-REFACTOR não-negociávelred-green vertical slices, refactor separado
Debuggingsystematic-debugging (4 fases)diagnosing-bugs (feedback loop)
Reviewsubagente de review sequencialreview paralelo (2 eixos) + baseline de 12 smells
Subagentes1 subagente por tarefa em sequênciagrilling + code-review subagents paralelos
Multi-harness10+ (Claude, Codex, Gemini, Cursor, opencode…)Claude Code flagship; editável para outros
Cross-references0 menções de Matt0 menções de obra; critica GSD/BMAD/Spec-Kit

Voz da comunidade por plataforma (deep research)

Hacker News

  • Pro-Superpowers: Evan Schwartz — “so much more productive… I cannot recommend it enough”; prplfsh — TDD “stops the model jumping to conclusions”; Simon Willison — “TDD é a metodologia-chave”.
  • Anti-Superpowers: d—b — “Claude faz mais erros com Superpowers”; ymulima — “Vapor AIware… ruído de verbosidade”; art=sin — “consumiu tokens absurdo, materialmente pior que plain Claude”; JonoClarke — KISS: nenhum framework melhor que plain Claude.
  • Pro-Matt: Bossie — “heavily rely on Matt Pocock’s Skills… highly valuable in practice”; wccrawford — “designed to be called by the user… makes a difference”; pipes — “grill-me e tdd me ajudaram massivamente”.
  • Migração observada: repositórios Token-Effort, agentic-code-stack, agentbase apontaram para migração Superpowers→Matt por peso e flexibilidade.
  • Enterprise skepticism: “Claude usage is mandatory coupled with a proprietary superpowers/speckit framework with 100+ agents” (Ask HN).

YouTube (0 cross-comparison direto)

  • Superpowers: CodeRabbit (Jesse Vincent) — “manage agents like MIT undergrad interns on IRC”; Eric Tech — biggest selling point é TDD.
  • Matt: “5 Claude Code skills I use every day”; walkthrough completo — ideação→plan→spec→tickets→implement em uma sessão.

GitHub issues (crítica real por repo)

  • Superpowers: #446 (on-boarding confusion), #1192 (sem cross-session roadmap), 2106/2091/2084 (bootstrap Windows/WSL frágil).
  • Matt: #799 (ADR numbering races), #809 (/implement colide com /code-review), #802 (subagent grilling confunde main), #794 (wayfinder fumbles).

Projetos de fusão (composição consolidada)

Exemplos reais documentados do padrão “componha, não escolha”:

  • devflow (AppleCG) — grill Matt → brainstorm Superpowers → writing-plans.
  • omni-skills, dmi_superpowers (HundredBillion), lean-skills — combinam skills dos dois.
  • oh-my-opencode (canadiantim), LetTTGACO, ryanuo — grilling como optional scalpel + Superpowers como hard seatbelt.
  • Regra anti-colisão: nunca rodar ambos como rotas ativas no mesmo session — colisão de comandos (/review, /implement, /codebase-design existem nos dois).

Gaps de evidência

  1. Nenhum benchmark head-to-head publicado (comunidade pede, ninguém entregou).
  2. Comparação de custo de tokens é anedota, não medição.
  3. Voz X/Twitter + Reddit: sem acesso (auth-blocked / 403) — lacuna de evidência.
  4. Opinião do próprio Matt Pocock sobre Superpowers: ausente; seu README critica GSD/BMAD/Spec-Kit, nunca obra/superpowers.

DevFlow como exemplar concreto de composição (2026-08-07)

O AppleCG/devflow é a evidência mais explícita de que os dois frameworks são complementares, não rivais. Ele é um plugin de Claude Code que funde 3 frameworks num pipeline único:

FrameworkPapel no DevFlow
obra/superpowers (~240k★)Execution Discipline — TDD, subagent-driven dev, debugging sistemático, git worktrees
mattpocock/skills (~151k★)Design Sharpening — grill interview, domain modeling, ADRs, glossário
Fission-AI/OpenSpec (~58k★)Spec Management — proposal → delta specs → archive

Pipeline: Idea → Grill → Spec → Plan → Apply → Review → Archive, com estado compartilhado em um diretório devwork/ — resolve a perda de conhecimento entre estágios.

Três modos (auto-roteados por intenção):

  • Design (“how should I…”): Quick-Grill (5 perguntas) → Spec-lite → proposal.md + CONTEXT.md + ADR.
  • Build (“implement…”): pipeline completo de 8 estágios → código + testes + specs + docs.
  • Fix (“X is broken”): Diagnose → TDD fix → Verify → Archive.

O valor pro comparativo: confirma que a borda de valor é Superpowers executa, Matt alinha — e que a integração precisa ser explícita (não automática). A limitação (documentada pelo próprio DevFlow) é que os frameworks “não se conectam automaticamente” — daí o diretório devwork/ e o roteamento explícito.

Teste A/B real (Addy Osmani, 2026-08)

O comparativo de Addy Osmani (agência dele) é o dado mais concreto sobre a escolha: ele rodou os dois e reportou eficiência de token idêntica; ambos replanificaram uma vez. A diferença não é custo — é o momento:

  • “Tarefa grande e ambígua, para delegar e se afastar?”Superpowers. O pipeline e o código de revisão por subagent foram feitos para rodar muito e devolver algo já revisado contra a spec.
  • “Loop diário rápido, especialmente acertando requisitos?”Matt Pocock. O centro de gravidade é o grilling (uma pergunta por vez, caminha cada branch da design tree, prefere ler o codebase a perguntar, só avança com entendimento compartilhado); distingue user-invoked vs model-invoked para tratar contexto do agente como recurso escasso.

Insight: a decisão não é “qual é melhor”, é “qual formato o trabalho pede agora” (delegar vs. iterar). Um A/B real de autoridade confirma a complementaridade que o resto da análise já sugeria.

Sources

^[raw/papers/disciplined-execution-vs-flexible-tooling.md]