Reflexion

Summary

  • Técnica que permite ao LLM refletir sobre suas próprias saídas e aprender com erros.
  • O modelo recebe feedback sobre suas ações e usa essa informação para melhorar em tentativas futuras.
  • Útil para agentes autônomos que precisam de autoaperfeiçoamento. Guia EN e paper Shinn et al. 2023 confirmam loop ator → avaliador → reflexão verbal → memória episódica. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]

Definição

Reflexion adiciona um ciclo de autoavaliação onde o LLM examina seus outputs anteriores, identifica erros ou oportunidades de melhoria, e ajusta seu comportamento nas iterações seguintes. Shinn et al. definem verbal reinforcement learning — reflexão linguística sem update de pesos, com ganhos em ALFWorld, HumanEval vs ReAct.

prompt-engineering-techniques | react-prompting | ai-agents-guide

Arquitetura — Actor / Evaluator / Self-Reflection

Reflexion decompõe o agente em três papéis que operam em episódios. O Actor gera trajetória (estado → ação → observação) usando chain-of-thought ou react-prompting mais memória de contexto. O Evaluator pontua a trajetória (reward escalar ou classificação binária) via heurística ou LLM — em AlfWorld, heurística + GPT atinge 130/134 acertos. A Self-Reflection (LLM) converte reward + trajetória + memória persistente em feedback verbal específico, armazenado em memória episódica para guiar o próximo episódio. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]

Passos: a) definir tarefa, b) gerar trajetória, c) avaliar, d) refletir, e) gerar próxima trajetória. Estende ReAct com avaliação, reflexão e memória.

Implications: Separe geração e julgamento — Actor sem reflexão repete erros; reflexão verbal dá correção direcionada sem custo de fine-tuning, mas depende da qualidade do Evaluator.

chain-of-thought | react-prompting | self-consistency

Resultados

Reflexion supera baselines em três famílias. Guia e paper reportam: AlfWorld 130/134 com ReAct+Reflexion vs ReAct; HotPotQA com Reflexion+CoT vs CoT; e HumanEval 91% pass@1 (Reflexion) vs 80% GPT-4 SOTA anterior, também ganhos em MBPP/LeetCode Hard e Rust. Paper v4 (2023-10-10) acrescenta ablações sobre sinais de feedback, métodos de incorporação e tipos de agente. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]

Implications: Ganho vem de memória verbal, não de pesos — ideal quando dados/compute de RL são inviáveis e feedback nuanceado importa; trace métrica por tarefa pois ganho varia por domínio.

Quando Usar e Limitações

Usar quando: agente aprende por tentativa-e-erro (decisão sequencial, raciocínio, programação), RL tradicional é custoso, feedback precisa ser nuanceado, e interpretabilidade/memória explícita importa. Limitações: depende da capacidade de autoavaliação (melhora com modelo), memória em janela deslizante (para tarefas longas, migrar para vetor/SQL), e limitações de TDD na geração de código (funções não-determinísticas, I/O dependente de hardware).

Implications: Prefira Reflexion para loops autônomos curtos com evaluators confiáveis; para episódios longos, planeje persistência de memória fora da janela.

Open Questions

  • Reprodutibilidade do 91% HumanEval em modelos 2025-2026 e com evaluators diferentes?
  • Tradeoff janela deslizante vs store vetorial/SQL em episódios >20 passos?

Sources

  • raw/prompts/articles/promptingguide-pt-techniques-reflexion.md
  • raw/external/www-promptingguide-ai-reflexion-8b219b90.md
  • raw/external/arxiv-org-2303-11366-806c90da.md