Skip to content

CoCoT — 3 passos para ensinar a IA a compreender o que vê

_CoCoT — 3 Passos para ensinar a IA a compreender o que vê

CoCoT — 3 Passos para ensinar a IA a compreender o que vê

O Cognitive Chain-of-Thought (CoCoT) é uma técnica de prompting para modelos multimodais que trabalham com imagens (com ou sem texto).
Em vez de descrever apenas objetos, o CoCoT estrutura o raciocínio da IA para interpretar o que significa o que é visto — incluindo contexto social e normas éticas.

Ver não é o mesmo que compreender

Modelos como ChatGPT, Gemini ou Claude Opus Vision
“veem” imagens e respondem a perguntas. Mas há um desafio: ver não é compreender.
A identificação de objetos é diferente de interpretar intenções, emoções e normas sociais numa cena.

O CoCoT surge para colmatar esta lacuna, orientando a IA a raciocinar sobre imagens de forma estruturada e socialmente consciente.

CoCoT — Como ensinar a IA a compreender o que vê
CoCoT — Como ensinar a IA a compreender o que vê

O que é o CoCoT

O Cognitive Chain-of-Thought (CoCoT) é uma técnica de prompting para modelos multimodais (visuais-linguísticos).
Não é um novo modelo; é uma forma de orientar a IA a pensar em três fases quando analisa imagens (com ou sem texto associado).

  • Perceção — observar e descrever objetivamente a imagem: pessoas, ações, objetos, expressões, ambiente.
  • Situação — interpretar o que pode estar a acontecer: intenções, emoções, relações, risco.
  • Norma — avaliar o comportamento à luz de normas sociais, éticas e de segurança.

Exemplos práticos (imagens)

Exemplo 1: Conflito (negativo)

Imagem: um homem empurra outro numa rua movimentada.

  • Perceção: dois homens; um empurra o outro; expressões tensas; espaço público.
  • Situação: indica possível confronto físico ou desacordo.
  • Norma: empurrar é socialmente inaceitável e potencialmente perigoso.
  • Resumo: provável conflito físico em local público.

Exemplo 2: Ajuda (positivo)

Imagem: uma criança ajuda um idoso a atravessar a rua.

  • Perceção: criança e idoso numa passadeira; mãos dadas; carros parados.
  • Situação: colaboração para atravessar em segurança.
  • Norma: gesto de empatia e respeito, socialmente valorizado.
  • Resumo: interação positiva com valor social claro.

Porque é que o CoCoT é importante

  • Compreensão social: vai além de objetos e etiquetas — interpreta relações e intenções humanas.
  • Segurança e ética: incentiva respostas alinhadas com normas sociais e de segurança.
  • Explicabilidade: cada fase torna o raciocínio auditável e transparente.
  • Desempenho: estudos reportam melhorias médias (~+8%) em tarefas de raciocínio multimodal social.

Como aplicar o CoCoT na prática

Exemplo de instruções (prompt) para um modelo multimodal:

Instruções: Observa a imagem e segue três etapas: (1) Perceção — descreve objetivamente o que vês; (2) Situação — interpreta o contexto social; (3) Norma — avalia o comportamento segundo normas éticas e sociais. Termina com um Resumo claro.

Funciona com ChatGPT (modo visual), Gemini, Claude e outros modelos que aceitam imagem + texto.

Limitações e desafios

  • Normas culturais: valores variam entre contextos; é crucial sensibilidade cultural.
  • Custo de inferência: respostas mais estruturadas podem ser mais longas.
  • Investigação em curso: embora promissor, o método continua a ser aprimorado.

O futuro da compreensão visual

O CoCoT assinala a evolução de “ver objetos” para compreender relações humanas em imagens.
Aplica-se a robótica assistiva, análise de vídeo social, segurança/vigilância ética e educação.

Conclusão

O CoCoT é um passo importante na humanização da visão artificial: ajuda modelos multimodais a compreender o significado social do que veem, não apenas a descrevê-lo.
O futuro da IA não está em ver mais, mas em ver melhor.

Perguntas frequentes (FAQ)

O CoCoT é um modelo novo?

Não. É uma técnica de prompting para orientar o raciocínio de modelos multimodais.

O CoCoT é para texto ou para imagens?

É sobretudo para imagens (com ou sem texto associado). O objetivo é interpretar o significado social do que é visto.

Funciona sem pergunta textual?

Sim. O método estrutura a análise visual mesmo sem uma pergunta explícita, embora perguntas ajudem a focar a resposta.

Que benefícios traz para IA responsável?

Maior explicabilidade, melhor consciência social e respostas mais seguras.

Referência e leitura relacionada

Artigo original (arXiv):

Cognitive Chain-of-Thought: Structured Multimodal Reasoning about Social Situations

— Park, Deng, Kim, Eslami, Sap (2025).

Leitura relacionada no blog:

Engenharia de Contexto: A Nova Fronteira na Optimização de Modelos de Linguagem

Queres implementar CoCoT nos teus fluxos multimodais? Entra em contacto para uma avaliação.