Directional Stimulus Prompting
Summary (confidence: high)
- Um LM de política treinável gera estímulos/dicas para guiar um LLM congelado (Li et al., 2023).
- Usa aprendizado por reforço (RL) para otimizar a geração de dicas.
- Focado em tarefas de sumarização onde se deseja controlar o resumo gerado.
Definição (confidence: high)
No Directional Stimulus Prompting, um modelo de política pequeno e treinável gera dicas (estímulos direcionais) que orientam um LLM congelado (caixa preta) a produzir a saída desejada. O uso de RL permite otimizar a política para maximizar a qualidade do resultado.
prompt-engineering-techniques | prompt-engineering-guide | prompt-engineering-applications
Sources
- raw/prompts/articles/promptingguide-pt-techniques-dsp.md