Directional Stimulus Prompting

Summary (confidence: high)

  • Um LM de política treinável gera estímulos/dicas para guiar um LLM congelado (Li et al., 2023).
  • Usa aprendizado por reforço (RL) para otimizar a geração de dicas.
  • Focado em tarefas de sumarização onde se deseja controlar o resumo gerado.

Definição (confidence: high)

No Directional Stimulus Prompting, um modelo de política pequeno e treinável gera dicas (estímulos direcionais) que orientam um LLM congelado (caixa preta) a produzir a saída desejada. O uso de RL permite otimizar a política para maximizar a qualidade do resultado.

prompt-engineering-techniques | prompt-engineering-guide | prompt-engineering-applications

Sources

  • raw/prompts/articles/promptingguide-pt-techniques-dsp.md