Reflexion
Summary
- Técnica que permite ao LLM refletir sobre suas próprias saídas e aprender com erros.
- O modelo recebe feedback sobre suas ações e usa essa informação para melhorar em tentativas futuras.
- Útil para agentes autônomos que precisam de autoaperfeiçoamento. Guia EN e paper Shinn et al. 2023 confirmam loop ator → avaliador → reflexão verbal → memória episódica. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]
Definição
Reflexion adiciona um ciclo de autoavaliação onde o LLM examina seus outputs anteriores, identifica erros ou oportunidades de melhoria, e ajusta seu comportamento nas iterações seguintes. Shinn et al. definem verbal reinforcement learning — reflexão linguística sem update de pesos, com ganhos em ALFWorld, HumanEval vs ReAct.
prompt-engineering-techniques | react-prompting | ai-agents-guide
Arquitetura — Actor / Evaluator / Self-Reflection
Reflexion decompõe o agente em três papéis que operam em episódios. O Actor gera trajetória (estado → ação → observação) usando chain-of-thought ou react-prompting mais memória de contexto. O Evaluator pontua a trajetória (reward escalar ou classificação binária) via heurística ou LLM — em AlfWorld, heurística + GPT atinge 130/134 acertos. A Self-Reflection (LLM) converte reward + trajetória + memória persistente em feedback verbal específico, armazenado em memória episódica para guiar o próximo episódio. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]
Passos: a) definir tarefa, b) gerar trajetória, c) avaliar, d) refletir, e) gerar próxima trajetória. Estende ReAct com avaliação, reflexão e memória.
Implications: Separe geração e julgamento — Actor sem reflexão repete erros; reflexão verbal dá correção direcionada sem custo de fine-tuning, mas depende da qualidade do Evaluator.
chain-of-thought | react-prompting | self-consistency
Resultados
Reflexion supera baselines em três famílias. Guia e paper reportam: AlfWorld 130/134 com ReAct+Reflexion vs ReAct; HotPotQA com Reflexion+CoT vs CoT; e HumanEval 91% pass@1 (Reflexion) vs 80% GPT-4 SOTA anterior, também ganhos em MBPP/LeetCode Hard e Rust. Paper v4 (2023-10-10) acrescenta ablações sobre sinais de feedback, métodos de incorporação e tipos de agente. ^[/raw/external/www-promptingguide-ai-reflexion-8b219b90.md]
Implications: Ganho vem de memória verbal, não de pesos — ideal quando dados/compute de RL são inviáveis e feedback nuanceado importa; trace métrica por tarefa pois ganho varia por domínio.
Quando Usar e Limitações
Usar quando: agente aprende por tentativa-e-erro (decisão sequencial, raciocínio, programação), RL tradicional é custoso, feedback precisa ser nuanceado, e interpretabilidade/memória explícita importa. Limitações: depende da capacidade de autoavaliação (melhora com modelo), memória em janela deslizante (para tarefas longas, migrar para vetor/SQL), e limitações de TDD na geração de código (funções não-determinísticas, I/O dependente de hardware).
Implications: Prefira Reflexion para loops autônomos curtos com evaluators confiáveis; para episódios longos, planeje persistência de memória fora da janela.
Open Questions
- Reprodutibilidade do 91% HumanEval em modelos 2025-2026 e com evaluators diferentes?
- Tradeoff janela deslizante vs store vetorial/SQL em episódios >20 passos?
External Links
Sources
- raw/prompts/articles/promptingguide-pt-techniques-reflexion.md
- raw/external/www-promptingguide-ai-reflexion-8b219b90.md
- raw/external/arxiv-org-2303-11366-806c90da.md