Tree of Thoughts (ToT)

Para tarefas complexas que exigem exploração ou planejamento estratégico, técnicas tradicionais ou simples de estímulo são insuficientes. Yao et al. (2023) e Long (2023) propuseram recentemente a “Tree of Thoughts” (ToT), uma estrutura que generaliza o chain-of-thought e incentiva a exploração de pensamentos que servem como etapas intermediárias para a resolução de problemas gerais com modelos de linguagem.

Summary (confidence: high)

  • Generaliza o chain-of-thought permitindo exploração de múltiplos caminhos de raciocínio em árvore.
  • Combina geração e avaliação de pensamentos com algoritmos de busca (BFS, DFS, beam search).
  • Supera significativamente CoT e few-shot em tarefas que exigem planejamento estratégico.
  • Permite avaliação deliberada do progresso dos pensamentos intermediários.

Definição (confidence: high)

ToT mantém uma árvore de pensamentos, onde os pensamentos representam sequências coerentes de linguagem que servem como etapas intermediárias para a resolução de um problema. Essa abordagem permite que um modelo de linguagem (LM) avalie o progresso dos pensamentos intermediários em direção à resolução de um problema por meio de um processo de raciocínio deliberado. A capacidade do LM de gerar e avaliar pensamentos é combinada com algoritmos de busca para permitir a exploração sistemática de pensamentos com planejamento de lookahead e retrocesso.

Ao usar a ToT, tarefas diferentes requerem a definição do número de candidatos e o número de pensamentos/etapas. Por exemplo, como demonstrado no artigo, o jogo “Game of 24” é usado como uma tarefa de raciocínio matemático que exige a decomposição dos pensamentos em 3 etapas, cada uma envolvendo uma equação intermediária. Em cada etapa, os 5 melhores candidatos são mantidos (b=5).

Para realizar a busca em largura (BFS) na ToT para a tarefa “Game of 24”, o LM é solicitado a avaliar cada candidato de pensamento como “certo/talvez/impossível” em relação à obtenção do valor 24. O objetivo é promover soluções parciais corretas que podem ser julgadas com poucas tentativas de planejamento futuro e eliminar soluções parciais impossíveis com base em senso comum de ‘muito grande/pequeno’, mantendo o restante como ‘talvez’. Os valores são amostrados 3 vezes para cada pensamento.

Abordagens (confidence: high)

  • Yao et al. (2023): usa BFS, DFS e beam search como estratégias de busca. O sistema mantém uma árvore de pensamentos com avaliação de cada nó.
  • Long (2023): usa um “Controlador ToT” treinado via aprendizado por reforço para decidir quando retroceder. Diferente das estratégias genéricas, pode evoluir com novos dados (similar ao AlphaGo vs. busca por força bruta).
  • Hulbert (2023): técnica simplificada aplicando o conceito ToT como estímulo único, fazendo o LLM avaliar pensamentos intermediários.

prompt-engineering-techniques | chain-of-thought | self-consistency

References

Sources

  • raw/prompts/articles/promptingguide-pt-techniques-tot.md