CoCoT — 3 Passos para ensinar a IA a compreender o que vê
Índice
ToggleO Cognitive Chain-of-Thought (CoCoT) é uma técnica de prompting para modelos multimodais que trabalham com imagens (com ou sem texto).
Em vez de descrever apenas objetos, o CoCoT estrutura o raciocínio da IA para interpretar o que significa o que é visto — incluindo contexto social e normas éticas.
Ver não é o mesmo que compreender
Modelos como ChatGPT, Gemini ou Claude Opus Vision já
“veem” imagens e respondem a perguntas. Mas há um desafio: ver não é compreender.
A identificação de objetos é diferente de interpretar intenções, emoções e normas sociais numa cena.
O CoCoT surge para colmatar esta lacuna, orientando a IA a raciocinar sobre imagens de forma estruturada e socialmente consciente.

O que é o CoCoT
O Cognitive Chain-of-Thought (CoCoT) é uma técnica de prompting para modelos multimodais (visuais-linguísticos).
Não é um novo modelo; é uma forma de orientar a IA a pensar em três fases quando analisa imagens (com ou sem texto associado).
- Perceção — observar e descrever objetivamente a imagem: pessoas, ações, objetos, expressões, ambiente.
- Situação — interpretar o que pode estar a acontecer: intenções, emoções, relações, risco.
- Norma — avaliar o comportamento à luz de normas sociais, éticas e de segurança.
Exemplos práticos (imagens)
Exemplo 1: Conflito (negativo)
Imagem: um homem empurra outro numa rua movimentada.
- Perceção: dois homens; um empurra o outro; expressões tensas; espaço público.
- Situação: indica possível confronto físico ou desacordo.
- Norma: empurrar é socialmente inaceitável e potencialmente perigoso.
- Resumo: provável conflito físico em local público.
Exemplo 2: Ajuda (positivo)
Imagem: uma criança ajuda um idoso a atravessar a rua.
- Perceção: criança e idoso numa passadeira; mãos dadas; carros parados.
- Situação: colaboração para atravessar em segurança.
- Norma: gesto de empatia e respeito, socialmente valorizado.
- Resumo: interação positiva com valor social claro.
Porque é que o CoCoT é importante
- Compreensão social: vai além de objetos e etiquetas — interpreta relações e intenções humanas.
- Segurança e ética: incentiva respostas alinhadas com normas sociais e de segurança.
- Explicabilidade: cada fase torna o raciocínio auditável e transparente.
- Desempenho: estudos reportam melhorias médias (~+8%) em tarefas de raciocínio multimodal social.
Como aplicar o CoCoT na prática
Exemplo de instruções (prompt) para um modelo multimodal:
Instruções: Observa a imagem e segue três etapas: (1) Perceção — descreve objetivamente o que vês; (2) Situação — interpreta o contexto social; (3) Norma — avalia o comportamento segundo normas éticas e sociais. Termina com um Resumo claro.
Funciona com ChatGPT (modo visual), Gemini, Claude e outros modelos que aceitam imagem + texto.
Limitações e desafios
- Normas culturais: valores variam entre contextos; é crucial sensibilidade cultural.
- Custo de inferência: respostas mais estruturadas podem ser mais longas.
- Investigação em curso: embora promissor, o método continua a ser aprimorado.
O futuro da compreensão visual
O CoCoT assinala a evolução de “ver objetos” para compreender relações humanas em imagens.
Aplica-se a robótica assistiva, análise de vídeo social, segurança/vigilância ética e educação.
Conclusão
O CoCoT é um passo importante na humanização da visão artificial: ajuda modelos multimodais a compreender o significado social do que veem, não apenas a descrevê-lo.
O futuro da IA não está em ver mais, mas em ver melhor.
Perguntas frequentes (FAQ)
O CoCoT é um modelo novo?
Não. É uma técnica de prompting para orientar o raciocínio de modelos multimodais.
O CoCoT é para texto ou para imagens?
É sobretudo para imagens (com ou sem texto associado). O objetivo é interpretar o significado social do que é visto.
Funciona sem pergunta textual?
Sim. O método estrutura a análise visual mesmo sem uma pergunta explícita, embora perguntas ajudem a focar a resposta.
Que benefícios traz para IA responsável?
Maior explicabilidade, melhor consciência social e respostas mais seguras.
Referência e leitura relacionada
Artigo original (arXiv):
Cognitive Chain-of-Thought: Structured Multimodal Reasoning about Social Situations
— Park, Deng, Kim, Eslami, Sap (2025).
Leitura relacionada no blog:
Engenharia de Contexto: A Nova Fronteira na Optimização de Modelos de Linguagem
Vítor Martins é consultor, formador e contabilista certificado, com mais de 30 anos de experiência em gestão, contabilidade e otimização fiscal. Pós-graduado em Marketing Digital e com formação universitária internacional em Inteligência Artificial, é especialista na aplicação de IA a pequenas e médias empresas. Pioneiro na integração de tecnologias inteligentes na contabilidade e gestão, atua como mentor e consultor estratégico, ajudando empreendedores a digitalizar os seus negócios com soluções eficientes e sustentáveis.