Multimodal CoT

Summary (confidence: high)

  • Extensão do chain-of-thought que incorpora texto e visão em uma estrutura de dois estágios (Zhang et al., 2023).
  • Primeira etapa: geração de raciocínio baseado em informações multimodais (texto + imagem).
  • Segunda etapa: inferência da resposta final usando o raciocínio gerado.
  • Um modelo CoT multimodal de apenas 1B supera o GPT-3.5 no benchmark ScienceQA.

Definição (confidence: high)

Diferente do CoT tradicional (focado apenas em linguagem), o Multimodal CoT processa entradas visuais e textuais simultaneamente. A primeira fase gera fundamentos racionais considerando ambas as modalidades; a segunda fase usa esses fundamentos para produzir a resposta.

prompt-engineering-techniques | chain-of-thought | prompt-engineering-guide

Sources

  • raw/prompts/articles/promptingguide-pt-techniques-multimodalcot.md