Sumário
FLAN (Finetuned Language Net) é uma família de modelos desenvolvida pelo Google que explora os benefícios do ajuste fino por instrução em escala. O estudo demonstra que escalar o número de tarefas de instrução (1.800 tarefas) e o tamanho do modelo melhora significativamente o desempenho em configurações zero-shot, few-shot e cadeia de pensamento (CoT).
Capacidades (confidence: high)
- Flan-PaLM: Melhoria de 14,9% em TyDiQA one-shot e 8,1% em raciocínio aritmético multilíngue
- Flan-T5: Supera o checkpoint público T5 em tarefas few-shot
- O ajuste fino CoT desbloqueia raciocínio zero-shot ativado pela frase “vamos pensar passo a passo”
- Melhora o desempenho em benchmarks de IA responsável (RAI)
Fonte: Scaling Instruction-Finetuned Language Models
Implicações
O FLAN demonstrou que o ajuste fino por instrução escala com o número de tarefas e tamanho do modelo, estabelecendo uma base para modelos como o gpt-4 e llama que usam técnicas similares de instrução.
llm-models-guide | prompt-engineering-techniques | dair-ai
Sources
- raw/prompts/articles/promptingguide-pt-models-flan.md