Pular para o conteúdo
~/.primo-academy.sh
☰ Aulas · Prompt Engineering · 0/24
Recomendado: essencial

Multimodal: imagem, áudio e vídeo como input e output

3 min de leitura

fonte

Até agora tratamos o modelo como entrada texto → saída texto. Mas em 2026, os modelos são multimodais de verdade: recebem imagem, áudio, vídeo, PDF, e podem gerar imagem, áudio e (em alguns casos) vídeo. Isso muda a anatomia do prompt - porque agora a entrada também é mídia, e "prompt bem-feito" precisa saber lidar com isso.

O que é multimodal (e o que cada modelo cobre)

  • Entrada de imagem - a maioria dos modelos principais (Claude Sonnet 4, GPT-4o, Gemini 1.5/2) aceita imagens. Você envia junto com texto e o modelo "vê".
  • Entrada de áudio - input de voz (transcrição + análise). Whisper da OpenAI, modelos multimodais nativos.
  • Entrada de vídeo - frame a frame ou amostragem. Gemini é o mais robusto aqui.
  • Entrada de PDF - parsing de página, com leitura de tabelas e texto. Claude e GPT-4o bem maduros.
  • Saída de imagem - DALL·E, Stable Diffusion, Midjourney, Imagen. Modelos diferentes dos LLMs em geral.
  • Saída de áudio - TTS (text-to-speech) como ElevenLabs, OpenAI TTS, e os modelos multimodais nativos.

Como prompting multimodal difere do texto

Três mudanças práticas:

1. O "prompt" inclui a mídia

Você não escreve só texto - manda o arquivo (ou URL/base64) junto. A ordem importa: o modelo dá mais peso ao que vem primeiro, então estrutura com cuidado.

[imagem anexada]
[texto:] "Esta é a foto do produto. Liste 3 problemas visuais
que um cliente notaria e sugira correção pra cada um."

2. Instruções precisam ser específicas pra mídia

Pedir "descreva a imagem" dá resposta vaga. Pedir "extraia o texto visível na imagem, mantendo a hierarquia de títulos, e liste gráficos com seus eixos" dá resultado útil.

Dica geral: trate a imagem/PDF/áudio como uma fonte que você está fazendo o modelo ler. Quais informações você quer extrair? Em que formato? Com que nível de detalhe?

3. Multimodal aumenta alucinação em algumas tarefas

Curiosamente, dar uma imagem pode fazer o modelo "ver coisas" que não estão lá - especialmente em detalhes pequenos. Para tarefas factuais sobre imagens (ler placa, contar objetos, ler número de série), valide com outra fonte quando crítico.

Padrões de uso comuns

OCR e extração de dados de documentos

Suba um PDF ou foto de nota fiscal/recibo, peça:

"Extraia: data, valor total, CNPJ do emissor, itens da lista. Responda em JSON conforme o schema:

{
  \"data\": \"YYYY-MM-DD\",
  \"valor_total\": number,
  \"cnpj\": string,
  \"itens\": [{ \"descricao\": string, \"valor\": number }]
}
```"

Análise de imagem com contexto textual

"Esta é a foto do interior de um apartamento. O usuário procura um imóvel com: (1) cozinha integrada, (2) boa luz natural, (3) até R$ 3.500 de aluguel. Avalie se a foto atende e dê uma nota de 1-5 em cada critério, com justificativa."

Geração de imagem (text-to-image)

Aqui o "prompt" é o que vai pra API de difusão, não pro LLM. Regras diferentes:

  • Seja descritivo e específico ("uma mulher de 30 anos, cabelo castanho, blazer azul, em um escritório moderno com luz natural, estilo fotográfico, lente 50mm").
  • Especifique estilo (foto, ilustração, pintura, 3D).
  • Especifique enquadramento (retrato, paisagem, close-up).
  • Negativos ("sem texto, sem marca d'água") são tão importantes quanto positivos.

TTS (text-to-speech)

Modelos de TTS como ElevenLabs/OpenAI TTS têm configurações separadas do prompt - voz, velocidade, emoção. Em alguns casos, o "prompt" do TTS é o próprio texto a ser falado, com marcações tipo [pausa] ou [ênfase em].

// Quiz

Você está pedindo ao modelo para extrair dados de uma foto de uma nota fiscal. Como é o prompt ideal?

Escolha uma alternativa
  • Multimodal é o default em 2026. Modelos principais leem imagem, áudio, PDF, vídeo - e geram imagem/áudio.
  • A anatomia do prompt muda: mídia anexada + instrução textual específica.
  • OCR e extração de documentos são os usos mais comuns em produção - e pedem JSON Schema, não prosa.
  • Geração de imagem tem prompt próprio (vai pra modelo de difusão, não LLM) - regras diferentes.
  • Validação adicional - multimodal alucina detalhes; checar fatos críticos.

Dica: trate cada modalidade como um tipo de fonte diferente. Texto é o que o modelo "leu", imagem é o que o modelo "vê", áudio é o que o modelo "ouviu". O prompting multimodal é, no fundo, "ensinar o modelo a ler cada fonte com critério".

No próximo nó, vamos tratar do lado sombrio de tudo isso: como protejer seu sistema de quem tenta subverter os prompts - segurança e prompt injection.

// recursos

// avaliação da trilha

—
ainda sem avaliações