Multimodal CoT
Summary (confidence: high)
- Extensão do chain-of-thought que incorpora texto e visão em uma estrutura de dois estágios (Zhang et al., 2023).
- Primeira etapa: geração de raciocínio baseado em informações multimodais (texto + imagem).
- Segunda etapa: inferência da resposta final usando o raciocínio gerado.
- Um modelo CoT multimodal de apenas 1B supera o GPT-3.5 no benchmark ScienceQA.
Definição (confidence: high)
Diferente do CoT tradicional (focado apenas em linguagem), o Multimodal CoT processa entradas visuais e textuais simultaneamente. A primeira fase gera fundamentos racionais considerando ambas as modalidades; a segunda fase usa esses fundamentos para produzir a resposta.
prompt-engineering-techniques | chain-of-thought | prompt-engineering-guide
Sources
- raw/prompts/articles/promptingguide-pt-techniques-multimodalcot.md